Token导航 LogoToken导航

Mistral与Reflection同日发布开源模型Beam及Large 4

更新时间 2026-10-07来源 InfoQ正文 6704字阅读约 21分钟3 张图片
整理 | 褚杏娟

西方开放模型阵营开始提速。

当地时间 10 月 5 日,被称作“美版 DeepSeek”的美国创业公司 Reflection 发布首款开放权重模型 Beam;一天之后,法国 Mistral 推出迄今最大的 Mistral Large 4。两家公司发布模型时选择的主要比较对象高度一致:GLM、Kimi、DeepSeek、Qwen。

Hugging Face 数据显示,过去一年,中国模型已经占到平台模型下载量的约 41%,月度下载量和累计下载量均超过美国。DeepSeek、阿里 Qwen、月之暗面 Kimi、智谱 GLM、MiniMax、小米 MiMo 等模型轮番刷新开放模型能力上限,中国开放模型成为全球开源开发者的追赶对象。

另一方面,开放模型已经不再只是研究者和极客使用的“小众替代品”:Vercel AI Gateway 的生产流量数据显示,今年 8 月开放权重模型已经处理了其平台 56% 的 Token,而去年 12 月这个比例还不到 10%。因此,全球开放模型竞赛是必然的。

美欧开放模型同期亮相
“美版 DeepSeek”第一次交卷:还有差距

被寄予厚望的 Reflection 成立于 2024 年,两名创始人都来自 Google DeepMind:CEO Misha Laskin 曾负责 Gemini 的奖励建模,CTO Ioannis Antonoglou 则参与过 AlphaGo、AlphaZero,后来领导 Gemini 的人类反馈强化学习(RLHF)工作。

不过,Reflection 一开始并不是冲着“美版 DeepSeek”去的。公司最初聚焦自主编程,希望用强化学习打造能够自主完成复杂工作的“超级智能系统”,同时原本判断西方会不断出现足够强的开放模型,Reflection 可以直接建立在这些模型之上。

真正改变公司路线的是 DeepSeek V3。按照 Reflection 创始人的说法,在中国开放模型快速推进、而西方迟迟没有出现同等级别替代品之后,公司决定自己训练前沿开放模型,并逐渐将目标明确为“把开放模型前沿重新带回西方”。

两年后,Beam 算是 Reflection 第一次真正交卷。

Beam 是一个 MoE 模型,总参数量 5010 亿,每个 Token 激活 230 亿参数,主要面向编程、推理和 Agent 工作负载。模型使用 23.8 万亿 Token 进行预训练,Reflection 又动用了 1.05 万张 Nvidia GB300,连续进行 4 周高算力强化学习,生成超过 1 亿次 rollout。模型目前仍处于最终红队测试阶段,Reflection 计划在 10 月份公开模型权重、技术报告和开发工具。

从 Reflection 自己公布的测试结果来看,Beam 最大的亮点并不是绝对能力,而是推理效率。公司称,在部分高级推理任务上,它能够以 GLM-5.2 约四分之一到三分之一的推理算力实现接近的表现。

但如果和中国最新一代模型横向比较,Beam 距离真正“追平”还有明显差距。

例如,在 Agent 编程测试 DeepSWE v1.1 中,Beam 得分为 44.4,几乎与 GLM-5.2 的 44.0 持平,但低于 GLM-5.3 的 61.0、Kimi K3 的 68.0,以及 DeepSeek V4.1 Flash 的 74.2;Terminal Bench v2.1 上,Beam 得分 80.1,而 GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash 分别达到 88.2、88.3 和 90.6。在 Humanity's Last Exam(HLE)上,Beam 得分 36.2,也低于 GLM-5.3 的 42.3 和 Kimi K3 的 46.9。

图片

因此,目前 Beam 把美国开放模型重新拉回了中国头部模型附近,但追上的主要还是前一代 GLM-5.2,与中国最新一轮开放模型还有一代左右的差距。

Reflection 自己对此也没有避讳。官方直接承认 Kimi K3 在绝对能力上仍然领先,并把 Beam 的卖点转向“单位推理算力能够换来多少智能”。CEO Misha Laskin 将 Beam 定位成企业可长期运行的“主力模型”,而不是单纯冲榜的最大模型。

这也很像 DeepSeek 最初打动市场的部分逻辑:价值不在于模型是不是第一,而是达到某个能力需要付出多少钱。区别在于,Reflection 很难称得上一个“低成本版 DeepSeek”。

Beam 单是最后一轮强化学习,就同时占用了超过 1 万张最新 GB300;公司已经融资数十亿美元,并从 Nvidia 获得大额投资,又通过 SpaceX、Nebius 等合作锁定大量算力。它是一个拥有美国资本和 Nvidia 最新硬件加持的“重资产版 DeepSeek”。

Ioannis 表示,公司未来几年的目标是让“开放前沿”和“封闭前沿”最终变成同一个前沿。2027 年,Reflection 计划发布规模更大的模型,同时继续扩大强化学习算力,并像 GLM 等模型一样,在基础模型之上连续推出多个强化学习增强版本。

Misha 则认为,这条路线背后其实是一个更大的判断:强化学习已经从过去 AlphaGo、AlphaZero 中的特定领域技术,变成了可以持续推动通用模型、编程模型和 Agent 模型进步的基础方法。

在他看来,目前这些模型“要么已经是某种形式的 AGI,要么至少已经非常清晰地处在通往 AGI 的连续路径上”。接下来的核心问题已经不只是如何把模型继续做强,而是如何把这种能力工程化、产品化,并通过一个多极化、开放程度更高的生态扩散出去。

Mistral 重新冲刺头部开放模型

相比刚刚推出第一款基础模型的 Reflection,欧洲模型厂商 Mistral 面临的压力其实更大。

两三年前,它一度是开放模型最具代表性的公司,但随着 DeepSeek、Qwen、Kimi、GLM 等模型快速迭代,Mistral 在前沿能力榜单上的存在感不断下降。今年 9 月,CEO Arthur Mensch 接受采访时甚至被直接问到:Mistral 的模型已经跌到 Artificial Analysis 排名 20 名之外,是不是被美国和中国甩开了?

Mensch 当时的回应是,新一代大模型即将发布,而且公司未来一年已经规划了接下来两代产品;Mistral 刚融资的资金将大量用于扩大训练算力,未来可调用的训练计算量可能提高约 20 倍。

两周后,Mistral Large 4 出现了。

Mistral Large 4 激活参数 520 亿,总参数 1.05 万亿,搭载 16 亿参数的视觉编码器,同时原生支持多模态和超过 160 种语言,上下文窗口达到 100 万 Token。值得注意的是,它是在 Mistral 位于欧洲的数据中心中,使用约 3800 张 Nvidia Grace Blackwell GPU 从头训练而成;模型目前已经开放 API 预览,完整权重将在 10 月底发布。

Mistral 官方公布的 Coding Agent Index 中,Large 4 已经超过 DeepSeek V4 Pro 和 Qwen 3.8 Max,但低于 Kimi K3;在与第三方 Surge AI 合作进行的盲测中,专业评审给 Large 4 的代码质量评分为 3.74,低于 Claude Opus 5 的 4.22,但高于 Kimi K3 的 3.59、GLM-5.3 的 3.60 和 GLM-5.2 的 3.40。

Mistral 明显在抢“企业 Agent”而不是只抢开发者。在 AutomationBench 的 657 个跨 Gmail、Google Sheets、Slack、Salesforce 等应用的业务工作流中,Mistral 称 Large 4 超过了 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro,但低于 GLM-5.3。在科学代码、网络安全以及部分金融、法律任务上,Mistral 同样宣称已经达到开放模型头部水平。

这次,Mistral 还特别介绍了网络安全能力。 Mistral 称 Large 4 已进入 Artificial Analysis Cyber Index 全球前五,在其中一个“复现真实漏洞并修复”的任务上达到 82%,是该测试最高分;Cybench 上完成 93% 挑战。Mistral 还刻意强调,部分闭源模型因为安全拒绝机制,在某些漏洞复现任务上几乎无法作答,而开放权重模型可以由企业自己定义安全策略,并部署在私有云或本地环境。

当然,这些数据目前很大一部分来自 Mistral 自身测试,而且 Large 4 仍处在 public preview 阶段,真正的权重尚未开放。

补中国厂商初步跑通雏形的商业模式

模型能力之外,Mistral 和 Reflection 也在走一条国内厂商初步验证了的商业路线。

Reflection 是非常“美国式”商业故事:它希望建立一个新的完整 AI 基础设施提供商,从基础模型出发,向上承接推理、Agent、软件和企业部署,向下深入算力管理、集群调度,长期甚至自己拥有数据中心。

他认为,模型、应用、云计算、裸金属等每一层长期都会商品化,真正能够持续获得较高利润的公司,往往是把整个技术栈垂直整合起来的公司。Misha 甚至给出了一个很“硅谷味”的公式:

收入潜力 = 智能密度 × 算力规模 × 企业信任。

Misha 表示,开放模型本身不一定直接赚钱,但它能够创造巨大的推理需求。就像 Kubernetes 本身开放,却推动了云市场一样,开放模型会推动企业购买算力、推理和完整 AI 基础设施。因此,Reflection 真正卖的是围绕 Beam 建立整套智能基础设施的能力。

它甚至把自己与早期 AWS、GCP 类比。AWS 最初是 Amazon 为解决自己的服务器基础设施问题而发展出来的,Google Cloud 则来自 Google 支撑搜索业务形成的大规模分布式系统能力。Reflection 的逻辑是,自己为了训练前沿模型,本来就必须解决数万亿 Token 服务、数十亿 Agent 沙箱、GPU 调度等问题,这些内部技术最终也可以像云计算一样向外输出。

Mistral 的商业模式同样强调企业部署,但它更偏向“欧洲版全栈 AI”。

Arthur 主张,小而高效、能够定制和部署的开放模型,比只追求最大规模的通用模型更加符合企业需求。Mistral 同时建设自己的模型、企业定制平台和欧洲算力基础设施,希望成为从训练、推理到部署都能够发生在欧洲法律和基础设施体系内的供应商。

在其看来,欧洲企业不能把核心 AI 能力完全建立在别国厂商是否愿意继续提供服务之上,也不能把自己的技术底座转而交给他国模型。Mistral 因此不仅要自己训练模型,还在欧洲建设数据中心,希望控制从算力、模型到企业部署的完整链条。

对国内开放模型的态度

两家公司一个身处欧洲,一个来自美国,但近期创始人的公开表态显示,他们对开放模型正在形成一套越来越相似的判断:AI 市场已经从“谁能提供最好用的 API”,进入“谁拥有模型、谁控制基础设施”的阶段。

在“为什么必须做开放模型”这个问题上,Reflection 的解释是:AI 市场正在从“租赁智能”走向“拥有智能”。

Misha 将闭源 API 比作“租房”。过去三年,AI 商业市场刚刚形成,企业调用 OpenAI、Anthropic、Google 等公司的模型,本质上是在租用智能。这种模式在市场早期足够简单,也足够高效。但随着 AI 真正进入企业核心业务,事情开始发生变化。

“几年前还很小的创业公司已经成长为大型企业,大型企业自己也开始真正使用 AI,所有权市场自然就出现了。”Misha 表示,如果一家公司希望真正拥有智能,就必须能够把模型部署在自己的基础设施上,控制数据、修改模型、进行定制,而这意味着模型必须足够开放。

Ioannis 则从技术角度表示,开放模型与闭源模型最前沿之间的距离正在缩小,而且“没有任何技术理由会决定开放模型必须永远落后”。在他看来,只要拥有足够的人才和算力,开放模型完全有能力做到与闭源模型相同的水平。过去企业不用开放模型,一个核心原因只是“能力还不够”;现在,一批中国开放模型已经能直接替代闭源模型完成大量任务,商业迁移的前提开始成立。

Mistral CEO Arthur Mensch 的判断与 Reflection 在这一点上非常接近。在他看来,随着开放模型能力提升,大量企业已经没有必要继续为闭源模型支付额外的 API 溢价。他近期表示,Mistral 接触的大约 99% 企业场景都可以用开放模型完成。

那为什么过去一年是中国模型先跑出来呢?

两家公司对此的判断也颇为一致:中国开放模型的领先不是单纯某一家公司偶然跑出一款好模型,而是商业激励、产业环境和训练资源共同作用的结果。

Misha 表示,美国过去其实也曾拥有最强的开放模型,Llama 3 就是一个明显节点。但当时美国 AI 商业市场仍然以 API 为主,Meta 或其他公司并没有足够强的商业动力持续把最前沿能力开放出去。

中国的情况不同。DeepSeek V3 是一个重要转折点,它第一次让来自中国的开放“智能”在全球形成大规模影响,此后中国出现了一次更集中的开放模型推进。Misha 认为,这背后相当一部分动力来自:建设自己的开放权重生态,本身就具有产业和战略价值。

“实际上,这些中国实验室直到最近都没有赚到太多钱。只是现在它们的模型能力足够强了,同时市场也成熟到可以为开放智能买单,所以它们才开始真正产生收入。”Misha 说道。

Arthur 则从偏工程层面解释:中国头部实验室的算力虽然低于美国最大的几家 AI 公司,但仍然高于 Mistral;与此同时,其会尽可能使用互联网上的数据,迭代方式也已工业化。这些条件让中国实验室能够快速迭代。

开放模型会不会更危险?

虽然两家公司都在积极为开放模型辩护,但都没有把自己描述成“所有模型都应该无条件开放”的极端开放派。

Reflection 的核心安全论点是,开放本身能够增加系统安全性。Misha 借用了开源软件世界里的“Linus 定律”:只要有足够多双眼睛,所有漏洞都会变得浅显。在他看来,封闭 AI 实验室只有几百名安全研究人员,不可能覆盖极其复杂模型里的所有长尾问题。如果开放模型能够让数十万研究者参与检查、攻击和修复,整个生态反而可能更加安全。

OpenAI 内部网络安全评测中的智能体越出测试环境并进入 Hugging Face 系统一事,被 Reflection 反复引用。Misha 认为,这件事说明单一安全哲学并不可靠:封闭模型可能因为安全护栏无法执行某些防御任务,而开放模型能够提供另一套工具。

Ioannis 进一步提出“用 AI 防御 AI”的思路。随着模型越来越强,未来一个行为异常的 Agent 可以被另一个 AI 系统发现和约束。模型和提供者越多,系统的冗余就越高;如果最强能力只集中在一两家公司手中,反而会形成“单点故障”。

但 Reflection 同样承认,开放并不是无限制的。Ioannis 明确表示,模型达到某种能力等级之后,部署方式需要更加谨慎;Misha 也表示,模型超过某个风险阈值后,行业和政府应该共同决定在什么条件下可以发布,以及是否需要访问控制。

Arthur 则近期公开反驳过关于超级智能失控风险的说法。相比主动减速,他更倾向于加强 Agent 监控、安全工程和实际治理。

这与 Anthropic 的立场其实也存在一部分重合。Anthropic 对开放权重的高风险扩散更加谨慎,但同样主张开放与闭源模型应该面对一致的能力安全门槛。

参考链接:

https://reflection.ai/blog/introducing-beam?utm_source=chatgpt.com

https://mistral.ai/news/mistral-large-4/?utm_source=chatgpt.com

https://www.youtube.com/watch?v=BKnAeVej0dc

https://mena.entrepreneur.com/business-news/live-from-ai-everything-abu-dhabi-2026-mistral-ais-arthur-mensch-on-the-divide-between-open-and-closed-ai?utm_source=chatgpt.com

https://www.lemonde.fr/economie/article/2026/09/24/arthur-mensch-directeur-general-de-mistral-ai-dans-l-ia-nous-sommes-les-seuls-completement-europeens-du-calcul-au-deploiement-dans-les-entreprises_6781335_3234.html?utm_source=chatgpt.com

声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

文章标签DeepSeek模型发布开源大模型出海
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多