
Google发布Gemma412B开源模型:主打无编码器全模态,16GB内存笔记本可本地运行
Google日前正式发布全新开源大模型Gemma412B,标志着端侧全模态AI迎来突破性进展。该模型颠覆了传统多模态模型依赖视觉和音频外部编码器的复杂链路,创新性地采用“Unified”无编码器架构。 通过这一设计,文字、图像、音频及视频四种模态的原始数据得以直接输入同一个Tra...
最近有哪些产品和公司在密集发生“开源”
想看最近哪些产品、模型和公司在集中出现“开源”相关动作,这一页会更省时间。
相比泛资讯流,这里更适合直接跟踪这类事件本身的最新变化。
开源资讯
891
正文图片
3,799

Google日前正式发布全新开源大模型Gemma412B,标志着端侧全模态AI迎来突破性进展。该模型颠覆了传统多模态模型依赖视觉和音频外部编码器的复杂链路,创新性地采用“Unified”无编码器架构。 通过这一设计,文字、图像、音频及视频四种模态的原始数据得以直接输入同一个Tra...

字节跳动商业化技术团队近日正式开源了名为Bernini的全新视频生成与编辑框架。该框架核心主打“先理解、再生成”的协同机制,旨在有效解决传统模型由于无法精准理解复杂指令而导致的画面失控、帧间闪烁等行业痛点。 目前,Bernini在字节自建的测试中已稳居行业第一梯队。其推理代码与第...

快科技6月3日消息,今日, 京东宣布推出JoyAI-Echo长音视频生成框架,号称解决行业长期头疼的长视频生成三大难题:角色易崩、声音乱变、生成缓慢。 目前,JoyAI-Echo代码与权重已全部开源,项目页和GitHub代码仓库均已上线,开发者和创作者可进行体验和二次开发。 京东...
IT之家 6 月 3 日消息,京东今日宣布推出 JoyAI-Echo 长音视频生成框架,号称直接解决行业头疼已久的三大难题 —— 角色易崩、声音乱变、生成缓慢。 同时还实现了“对话式编辑”功能 ,不用再为改一个镜头重跑整条视频。 京东官方表示, JoyAI-Echo 的发布,标志...
据京东黑板报,6月3日,京东推出JoyAI-Echo长音视频生成框架,直接解决行业长期存在的“长视频生成三大难题”——角色易崩、声音乱变、生成缓慢。该框架实现了“对话式编辑”功能,无需为改一个镜头重跑整条视频。 JoyAI-Echo的发布,标志着京东在长视频生成领域进入全球第一梯...
据京东黑板报,6月3日,京东推出JoyAI-Echo长音视频生成框架,直接解决行业长期存在的“长视频生成三大难题”——角色易崩、声音乱变、生成缓慢。该框架实现了“对话式编辑”功能,无需为改一个镜头重跑整条视频。 JoyAI-Echo的发布,标志着京东在长视频生成领域进入全球第一梯...

2026年的儿童节,中文互联网非物质文化遗产天涯社区复活了。 这次复活其实并不突然,在关停的三年里,天涯年年都在挣扎着要出土。 因为拖欠海南电信服务器费用高达千万级别,欠款时间长达十多年,天涯在2023年年初被关停。 几个月后,已是编外人员的前执行总编宋铮自发带队在直播间义卖,想...

智东西(公众号:zhidxcom) 作者 | ZeR0 编辑 | 漠影 智东西6月3日报道,在Computex 2026台北国际电脑展上,英伟达发布物理AI领域的多项进展,包括开源世界基础模型Cosmos 3、面向物理AI的智能体工具和Skills、自动驾驶推理模型Alpamay...

中科大研究团队投稿 智猩猩AI整理 Agent赛道越火,长上下文能力越成为刚需。 当前主流做法要么靠人工精标长文档,成本高到离谱;要么靠启发式拼接短文本,长程依赖关系薄弱,训出来的模型"只见树木不见森林"。 中科大和上海创智学院的研究团队最新提出了一种低成本、可扩展的长上下文训练...
封面新闻记者 欧阳宏宇 记者6月3日获悉,行业首个聚焦物理交互的开源具身数据集对外开源。据介绍,该数据集面向世界模型、神经仿真器、物理感知以及表征学习等具身智能研究,系统记录机器人与真实物理世界之间复杂、高密度、非理想的交互过程,补齐了当前世界模型训练中长期缺失的真实物理交互数据...
开源与闭源大模型正沿两条截然不同的指数曲线加速分化,一场关乎AI行业权力格局的经济博弈正走向决定性时刻。 AI研究机构Interconnects AI研究员Nathan Lambert于6月1日发表分析指出,以Anthropic和OpenAI为代表的闭源前沿实验室,正凭借编程智能...

作者:李宝珠 编辑:yudi 转载请联系本公众号获得授权,并标明来源 HyperAI 官网(hyper.ai)的教程板块已经上线了「AutoFigure:基于 LLM 的学术论文插图自动生成系统」,以 Notebook 的形式基于 Free CPU 即可完成部署,快来免费体验高性...
开源与闭源大模型正沿两条截然不同的指数曲线加速分化,一场关乎AI行业权力格局的经济博弈正走向决定性时刻。 AI研究机构Interconnects AI研究员Nathan Lambert于6月1日发表分析指出,以Anthropic和OpenAI为代表的闭源前沿实验室,正凭借编程智能...

近日,安全研究员 Ammar Askar 公开了一条利用 VSCode 漏洞一键窃取 GitHub Token 的完整攻击链。攻击者无需密码、无需下载恶意程序,只要诱导用户打开一个特制链接,就有机会获取 GitHub Token,并获得对私有仓库的读写权限。 更具争议的是,在披露...
感谢IT之家网友 取什么名 的线索投递! IT之家 6 月 3 日消息,今天,智元正式开源 AGIBOT WORLD 2026 数据集第二期主题“多样交互(Rich Interaction)”。 据介绍,这是行业首个聚焦物理交互的开源具身数据集,面向世界模型、神经仿真器、物理感知...

AI 视频生成与编辑领域迎来底层逻辑的重构。字节跳动商业化技术团队近日正式开源了面向视频生成与视频编辑的统一框架——Bernini。该框架核心主打“先理解、再生成”的协同机制,旨在解决传统模型因无法精准理解复杂文本指令而导致画面失控、帧间闪烁等行业痛点。 传统的视频编辑往往面临主...

【文/观察者网 科工力量】 最近海外3D打印圈有个大瓜,欧美的开源社区,把一家中国3D打印新贵按在地上批斗了一个多月。这家中国公司叫拓竹科技。 事情起因不复杂。今年4月底,一个波兰开发者写了一段代码,绕过官方认证流程、模拟官方客户端接入拓竹云服务,触及云服务接入和安全边界。拓竹找...

IT之家 6 月 3 日消息,今天,智元正式开源 AGIBOT WORLD 2026 数据集第二期主题“多样交互(Rich Interaction)”。 据介绍,这是行业首个聚焦物理交互的开源具身数据集,面向世界模型、神经仿真器、物理感知以及表征学习等具身智能研究,系统记录机器人...

大模型早已从新鲜事物变成了越来越多投资者、研究员和知识工作者每天都在使用的工具。 但同样使用豆包、GPT、Claude,有的人已经让AI深度参与研究、分析和决策流程;有的人却仍停留在“帮我总结一下这篇文章”。 差距究竟来自模型本身,还是来自使用方式? 6月2日,公众号「Thea的...

机器之心发布 由格灵深瞳灵感实验室主导研发的 LLaVA-OneVision-2.0,是一款面向下一代感知智能的视觉语言大模型。团队充分利用视频 Codec 流和自研 OneVision-Encoder,实现跨帧、跨事件的增量观测和连续证据流建模。本文将详细介绍模型架构、训练方法...