Token导航 LogoToken导航

Mistral Large 4 发布:1万亿参数追平GPT-6 Luna

更新时间 2026-10-07来源 新智元正文 2745字阅读约 9分钟20 张图片

图片

  新智元报道  

图片

刚刚,欧洲最强AI杀回来了!

法国AI独角兽Mistral突然放出新旗舰Mistral Large 4,总参数1万亿,权重月底全部开源。

在第三方评测Artificial Analysis的智能指数里,它拿下38分,追平GPT-6 Luna。
这是欧美开源模型的第一名,第二名Thinking Machines的Inkling只有25分。用Artificial Analysis的话说,中美之外,它是全球最聪明的模型。
甚至在几项硬核测试上,Mistral Large 4还压过了GPT-6和Claude——
  • 法律Agent测试的分数是GPT-6 Astra的近3倍
  • 金融、视觉定位都赢了GPT-6 Astra
  • 科学编程赢了Claude Opus 5
在一道修漏洞的网安考题上,它更是拿下82%,全场最高。Claude Opus 5.5和GPT-6 Astra直接拒答,几乎交了白卷。
闭源巨头不敢接的活,这只「肥猫」全接了。
GPT-6交白卷的考题,它拿了82分

安全工程师修一个漏洞,第一步必须先把攻击打出来。打不出来,就没法确认漏洞在哪,更没法验证补丁到底管不管用。

所以「复现漏洞」听起来像在搞破坏,其实是修补的前一半。如果模型一看到「复现漏洞」就拒绝回答,等于把后一半也一起扔掉了。

在整个网安指数里,Mistral Large 4成功了50次,排进全球前五。

GPT-6 Astra成功33次,另有38次被自家安全机制拦下。Claude Opus 5.5成功29次,被拦下36次。

图片

两家闭源旗舰被拦下的次数,比做成的还多

Mistral在博客里直言,OA两家一刀切地拒答,挡住的恰恰是正当的漏洞研究和应急响应。

黑客早就在越狱闭源模型帮自己搞攻击,防守的一方却被同一套拒答捆住了手脚。

更要命的是,安全事故处理到一半,模型的能力突然被收走,本身就会变成一个重大的安全风险。

相比之下,Mistral Large 4不会卡在拒答上。

在收录了40道安全竞赛真题的Cybench上,它解出了93%。

图片

在Mistral内部一套19道的网安挑战题里,它解出了16道。

图片

在内部测试里,它还能分析恶意软件、给漏洞排优先级、写检测规则,这些活它都没专门练过。

Mistral给它扔了一个黑客常拿来作恶的CobaltStrike加载程序,没贴任何标签,全程没人插手。

它自己反编译、顺藤摸瓜找到命名管道,追出藏起来的加密载荷,最后把XOR加密破解开。

图片

与此同时,面对越狱攻击和恶意Agent任务,它的拒绝率比所有开源模型都高。

图片

在Lakera公开的B3 AI安全基准里,它挡住了93.3%的攻击,对手里没有更高的分数。

图片

从写代码到看卫星图,样样能打

能复现漏洞、亲手补漏洞,靠的是写代码的能力。

单论写代码,它在DeepSWE v1.1上拿到61.7%,SWE-Atlas-QnA拿到59.4%,Terminal-Bench 4拿到28.3%。综合编程Agent指数拿到49.8%,压过了两款顶级开源模型。

左右滑动查看

AutomationBench测试收录了657个真实的业务流程,模型要在Gmail、Google表格、Slack、Salesforce之间来回切换,把活一步步干完。Mistral Large 4在这项测试里拿到59.9%。

图片

AA-Briefcase考的是做表格、改PPT、出PDF这类长线知识工作,Mistral Large 4的Elo分达到1393。

第三方评测机构Vals AI拿真实的法律、金融任务去考,Mistral Large 4的表现超过了GPT-6 Astra。在法律AI公司Harvey的法律Agent基准上,它压过了所有开源模型。

代码、法律、金融之外,它也很会看图。

在十亿像素级的卫星图里,它能一点点找出目标,帮救灾队伍抢时间;对着工程图纸,它也能反复放大、检查、核对零件,直到答案准确为止。

给它一张真空翻转夹爪的装配图,问压缩弹簧会不会碰到滑动轴承。它在图里找到这两个零件,回答不会,因为中间隔着3号真空销。

图片

在视觉定位测试Dense 200上,它拿到42%,GPT-6 Astra是41.5%,连闭源旗舰都被它压了一头。

图片

在科学编程测试SciCode-Verified上,它拿到91.8%,是欧美开源模型里的最高分,还压过了Claude Opus 5的91.3%。

图片

放到实际科研里,它能一次写出完整的Hartree-Fock模拟代码。这是量子化学里计算分子电子结构的方法,要串起一长串复杂的计算步骤。

3800块Blackwell,从零喂出一只「肥猫」

Mistral给这个模型起的官方代号叫le Chonk。

chonk是网上形容超大号胖猫的梗,CEO Arthur Mensch还在X上亲自接梗:其实是「le gros chaton」,一只大胖猫。

它确实胖。

总参数1万亿,用的是混合专家架构,每生成一个token只叫醒其中490亿参数干活,所以胖而不慢。

它把指令、推理和Agent能力塞进了同一个模型,还能说160多种语言,欧盟所有官方语言全覆盖。

Mistral在欧洲自家机房里,用3800块英伟达Grace Blackwell从零训练了它,现在开放的预览版也跑在同一批机器上。

后训练靠的是大规模强化学习。

一套会自动扩缩的集群同时跑几万条尝试,单条任务轨迹能用掉几百万token,模型从自己每一次尝试的结果里学。

按现在的规模,一次训练每天能产出330亿token,过滤之后还剩约160亿可以直接拿来练。

在客服Agent、跨应用业务流程、Excel表格编辑、事实问答这四类任务上,训练奖励都在持续上升。

而且,这轮强化学习还没跑完,模型也完全没有到顶的迹象。Mistral的原话是,接下来几周到几个月,它还会有大幅、快速的提升。

模型还在练,预览版API已经在Mistral Studio上线,每百万token输入1.36美元、输出4.18美元。

完整权重月底放出,到时企业可以把它搬进私有云,或者直接装在自己的机房里。

万亿大脑的开关,交回用户手里

越往ASI走,模型能做的事越多,「谁来决定它能做什么」就越要紧。

过去两年,这个决定一直写在几家闭源厂商的安全策略里。同一个漏洞,GPT-6和Claude说不碰,靠它们干活的安全工程师就只能停手。

Mistral Large 4把一颗能和闭源旗舰掰手腕的万亿大脑,连同开关一起交了出去。

权重在自己手里,模型部署在哪、什么时候用,就不再由厂商说了算,也不会在关键时刻被一刀切断。

而它还只是一个没练完的预览版。

Mistral手握30亿欧元D轮融资,这是欧洲科技公司史上最大的一笔股权融资。这笔钱正用来扩建欧洲自家机房的算力,Mistral Large 4只是这条路线上的第一站。

参考资料:

https://mistral.ai/news/mistral-large-4/

编辑:摩西

文章标签ClaudeAnthropic安全
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多