Token导航 LogoToken导航

Anthropic发布Opus 5.5,Benchmark全面领先GPT-6 Astra

更新时间 2026-09-23来源 BubbleBrain正文 1474字阅读约 5分钟12 张图片
图片

终于,Anthropic 把 Opus 5.5 端上来了。

废话不多说,直接看Benchmark。

图片

光看Benchmark的话,实在是太残暴了。

几乎全面领先GPT-6 Astra,全方位的爆锤自家的Fable 5.1。

比较让我觉得意外的是Terminal-Bench 4.0 已经冲到66.4%了,而上一个SOTA 正是半个多月前才发布的GPT-6 Astra 。

图片

国内模型最好的成绩是GLM-5.3,成绩在41%。

可问题是Terminal-Bench 4.0这个Benchmark 的发布时间也不过是8月下旬,那个时候的SOTA模型的成绩还在40%左右。

AI圈的各领风骚数十天 真不是瞎说说的。

还有个非常值得注意的点是Token效率

这个是我认为国内模型当前最大的问题,也是OpenAI 和 Anthropic做的比较好的。如何能够使用尽可能少的Token消耗来达到优秀的完成效果。

图片

以Terminal-Bench 4.0为例,这次Opus 5.5 在这方面相比于 Opus 5 有了很大的提升,甚至已经包圆了我认为的Token效率之王,GPT-6 Astra 。

再来看Frontier Code 。

图片

按照Anthropic 的跑分,思考强度只需要开到medium 的时候,就已经拿到了最佳结果,而且成本消耗比GPT-6 Astra小不少。

但是这个图其实本身还蛮有趣的。

可以看到当思考强度开到high、甚至xhigh的时候,表现竟然都出现了下滑

还有一个这次很重要的更新,是语言表达能力

从Opus 4.6 之后,那个语言表达良好,沟通交流有思想深度的Claude 已经一去不复返了。但是这次Anthropic 自己说他们听取了社区的反馈,特意改善了这方面的表现。

它会把最重要的信息放到最前面,更少使用专业术语或者一些独特的表达方式,也会更好地遵循用户给它设定的写作规定。

可以看看Anthropic 官方给的例子。

比如总结slack上的内容,汇报给经理。

图片

很明显Opus 5.5的回复结构更清楚,信息组织的更加明白。

还有一个例子,更加明显我觉得。

图片

Opus 5的起手式就是甩一堆技术黑话,而用户只是想知道做了哪些改动。

最后是这次Opus 5.5 的价格,相比于Opus 5 还要便宜。

图片

每百万输入Tokens价格在$4,每百万输出Tokens输出在$20,都比Opus 5 要低。果然,能干掉我自己的还是只有我自己。

然后,来几个我自己迅速实测的case吧。

叠甲:不代表Opus 5.5 能力的强弱,只是觉得这些case有点意思。

比如常见的svg。画一个xbox 控制器

图片

还有一个给定参考图,通过svg 还原。

我给了一个小米su7海湾蓝的参考图,下面是Opus 5.5 的效果。

图片

但我实测,这个case是做的没有GPT-6 Astra  好的。 下面这个是GPT-6 Astra 做的。

图片

画SVG这块,还得是GPT-6 Astra!

当然,还有一些好玩的。 比如下面这两个。 一个是复刻梵高的星空,没有给参考图;还有一个是复刻Claude 官方X发布的那个视频

这两个case都是纯代码做出来的,没有用任何的图像生成或者视频生成模型。

星空复刻:

图片

太变态了这个。Opus 5.5 还是一如既往的有着很好的品味,跑了大概20分钟,纯靠代码做出了这个效果。

然后是视频复刻。

视频 · 01

Opus 5.5 纯用JS复刻的,包括配乐这些都是它自己去配的。为了对比,它甚至还帮我把原视频和它做的拼在一起。

视频 · 02

左边是原视频,右边是它用JS 复刻的。

我觉得能做到这个程度还是有点子厉害的。

好啦,今天的分享就先到这儿了。

OpenAI 还发了gpt-6-sol 和 gpt-6-luna,

赶紧打起来,打起来才是对用户最好的。

文章标签Anthropic产品更新
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多