
万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链
过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。 起因是 OpenAI 新旗舰模型 GPT-6 Astra 发布前两天,The Information 援引内部消息称,Astra 用上了一种叫 recurrent depth(循环深度)、也就是 looped tran...
大模型 方向最近有哪些内容值得看
大模型 方向的重要产品、公司和事件变化,会在这里更集中地出现。
如果你是按主题跟踪 AI 动态,这一页会比全站资讯流更好用。
大模型资讯
3,285
正文图片
13,314

过去两周里,「循环深度」这个词变成了 AI 安全讨论的焦点。 起因是 OpenAI 新旗舰模型 GPT-6 Astra 发布前两天,The Information 援引内部消息称,Astra 用上了一种叫 recurrent depth(循环深度)、也就是 looped tran...

品玩9月11日讯,据humanoidsdaily 报道,宇树科技宣布全面开源新一代通用人形机器人基础模型UnifoLM-WLA-1.0。该模型参数量为6B,在多项评测中刷新全球开源模型最佳成绩,实现单模型统筹桌面操作与全身移动。 模型采用三阶段架构,融合视觉理解与物理预测,通过M...
感谢IT之家网友 Domado 的线索投递! IT之家 9 月 9 日消息,蚂蚁集团今日宣布推出并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。 该模型基于 Ling-3.0-flash 的 MoE(混合专家)架构拓展,总参数量为 124B,单次推理激活 ...
感谢IT之家网友 不一样的体验、补药吖、麻辣清补凉、西窗 的线索投递! IT之家 9 月 9 日消息,综合新浪科技、第一财经报道,在今日的 2026 京东全球科技探索者大会上,京东集团技术委员会主席、京东云总裁曹鹏公布了京东在算力、数据和模型三大 AI 基建的最新进展。 算力方面...
IT之家 9 月 9 日消息,据博主 @超维界 透露,华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署,有多模态增强大模型(6GB 左右)和多模态混合专家大模型(15GB 左右)供自主选择下载。 博主表示, 两款大模型为端侧 AI,无网状态...

黄小艺|H997Hbiu 樊雅婷|FFF111f__ MiniMax H3 的开源,可能比外界看到得更仓促。 7 月 31 日,H3 与 Seedance 2.5 同日发布。外界很容易把它理解成一次提前设计的开源狙击:Seedance 2.5 刚刚把原生生成时长拉到 30 秒,M...
文 | 锦缎 2026年9月的第二个周六,Anthropic CEO达里奥·阿莫迪发表长文《We Must Pace the Frontier》。核心主张只有一句:"我们必须放慢提升AI模型能力的速度。" 如果这话出自学者,它只是又一份请愿书。但接下来48小时发生的...
文 | 独角兽观察,作者 | 挖哥,编辑 | 角叔 当地时间 9 月 12 日,全球AI赛道出现标志性转向:Anthropic 公开呼吁行业主动放缓前沿大模型迭代节奏,OpenAI CEO 奥尔特曼公开表态认同该主张,同时明确排除 2026 年推进 IPO 的计划。曾经全力冲刺模...

一个中小企业的技术负责人最近遇到了一个头疼的问题。他们采购了一批国产GPU卡,打算在自有环境里部署一个开源大模型,用于内部知识库问答。硬件到货之后,团队花了整整两周时间,模型还是跑不起来。问题不在于卡本身——单看标称算力,这批国产卡能达到国际主流产品的七八...

文|光锥智能,作者 | 魏琳华 ,编|刘俊宏 七、八、九三个月,大模型行业像打了鸡血。 从海外"御三家"到国内大模型厂商,轮番发布的新模型让人目不暇接。9月第一周,OpenAI、Anthropic、谷歌你方唱罢我登场,Claude Fable 5.1、Gemini Flash 3...

DeepSeek V4.1 Flash发布后,不仅速度变快,而且内容更准确,还有原生多模态。 全网对DeepSeek V4.1 Flash好评如潮,梁文锋再次被奉为“梁圣”。 相较于V4 Flash,V4.1 Flash最大的特点是推倒重来,采用了和V4 Flash完全不同的非对...
文 | 字母AI DeepSeek V4.1 Flash发布后,不仅速度变快,而且内容更准确,还有原生多模态。 全网对DeepSeek V4.1 Flash好评如潮,梁文锋再次被奉为"梁圣"。 相较于V4 Flash,V4.1 Flash最大的特点是推倒重来,采用了和V4 Fla...
蚂蚁集团 AI 安全实验室近日正式开源大模型内生式安全护栏技术 SingProbe。该技术区别于主流的外挂式安全审核模式,通过复用基座模型推理过程中的隐藏状态,以不足0.5% 的额外计算开销,实现 token 级实时风险评估,可同步完成意图分类、安全检测和幻觉识别任务,在医疗等高...

本文来自微信公众号: 硅谷101 ,作者:硅谷101 你相信,我们其实生活在一个虚拟世界中吗? 马斯克曾在Lex Fridman的采访中被问到:如果有一天人类实现AGI,并且只能向它提出一个问题,他会问什么? 思考了十秒之后,他给出的答案是: “What's outside th...
本文来自微信公众号: AIGC从0到1 ,作者:王零壹 2026年9月10日,上海交大、清华、字节、小红书、上海AI实验室等机构的一篇论文,在中文AI圈刷屏。 论文标题很大:《The Last AI Built by Humans》 人类建造的最后一个AI。 它描绘了这样一条路线...
本文来自微信公众号: AIX财经 ,作者:AIX财经团队,编辑:魏佳 买的是增长,还是入场券? AIX财经(AIXcaiijng)原创 B站刚学会赚钱,就准备把一整年的利润重新押出去。 2025年,这家公司第一次实现全年GAAP盈利,净利润11.9亿元。几个月后,管理层宣布,20...

本期速览: 1. 前字节腾讯AI核心研发孙鹏加盟星尘智能; 2. 智谱GLM5架构负责人白雨石加入腾讯混元; 3. 月之暗面被曝秘密递表港交所; 4. 原DeepSeek研究员魏浩然加入百度; 5. 百度BMU引入北美大模型预训练专家; 6. VAST完成约30亿元B轮及B+轮融...

你有没有玩过Wordle? 就是那个每天一个单词,你猜五个字母,系统告诉你哪个字母对了、哪个字母在但位置错了、哪个字母压根不在里面的游戏。这游戏简单到小学生都能上手,规则清清楚楚写在那儿。 但如果让一个只有20亿参数的小AI模型来玩呢? 结果可能让你意外。研究者发现,这个叫Qwe...

2026年初,有一群清华的研究者算了一笔账,算完之后他们自己都愣住了。 如果想复现SmolLM3-3B这个开源模型的训练过程,需要花多少钱?答案是71.9万美元。如果想复现Llama-3.2-3B呢?答案是150万美元。这些数字听起来像是某个大公司的年度预算,但事实上,这只是"从...

每经记者|宋欣悦 每经编辑|兰素英 《每日经济新闻》根据OpenRouter最新数据测算,上周(9月7日至9月13日)全球AI大模型总调用量为127万亿Token,环比增长10.43%。 其中,上榜的AI大模型中,中国AI大模型周调用量达61.17万亿Token,环比增长7.85...