Token导航 LogoToken导航

Anthropic 发布 Claude Sonnet 5.5 性能超 Opus 5.5

更新时间 2026-09-29来源 夕小瑶科技说正文 2428字阅读约 8分钟

Opus 5.5 发布还没满一周,Anthropic 又把自家的“中杯”更新了。

今天凌晨,Claude Sonnet 5.5 正式发布。

在 Terminal-Bench 4.0 编程评测中,成绩从上一代的 10.3% 提高到 70.6%,超过了大杯模型 Opus 5.5 。

与Sonnet 5相比,完成多数工作时,Sonnet 5.5 需要的 token 更少,单任务成本最多降低30%。

◈多项成绩逼近旗舰

先看这次的榜单,Sonnet 5.5 在编程能力的提升最明显。

在考察命令行多步骤任务的 Terminal-Bench 4.0 上,Sonnet 5.5 的 Max 档拿到了70.6%,超过了Opus 5.5 的66.4%。作为对照,Sonnet 5 的最高分是10.3%,

然后是 FrontierCode ,它考察的更接近代码交付:模型提交的修改,能不能不经人工改动就直接合并。

同样开到 High 档,Sonnet 5.5 得分49.4%,Sonnet 5 是39.4%。高了10个百分点,单任务成本约为上一代的十五分之一。

这个档位的成绩,也基本追平了 GPT-6 Sol 的最高分49.3%,成本约为其五分之一。

不过,档位并非越高越好。Sonnet 5.5 在这项评测中的最高分出现在 Xhigh,为52.1%;拉到 Max,反而降到了46.2%。

来自真实 Cursor 会话的 CursorBench 4.0,测试的是需求不完全明确、涉及多个文件的编程任务。

Sonnet 5.5 的最高分达到55.5%,上一代为34.1%,Opus 5.5 为57.8%,与旗舰的差距缩小到了2.3个百分点。

而在 Low 档,Sonnet 5.5 就拿到了35.8%,超过上一代 Max 档的34.1%,单任务成本同样不到后者的十分之一。

编程之外,知识工作的成绩也追了上来。

在覆盖多个行业和职业任务的 GDPval-AA 中,Sonnet 5.5 的 Elo 得分为1844,Opus 5.5 为1846,只差2分。

另一项 AA-Briefcase v1.1 测的是需要持续推进的长流程知识工作。Sonnet 5.5 的最高 Elo 得分为1811,上一代是1359,Opus 5.5 则是1822。

开到 Medium 档,Sonnet 5.5 得分1461,已经超过上一代 Max 档的1359,而单任务成本约为后者的九分之一。

第三方榜单也给出了相近的结果。

在 Artificial Analysis 的综合智能指数中,Sonnet 5.5 拿到56分,上一代 Sonnet 5 为38分。

按各模型系列的最高配置比较,它排到了第二,仅次于58分的 Opus 5.5;GPT-6 Astra 和 GPT-6 Sol 的整数分分别为53和48。

这些提升,官方也展示了比较直观的例子。

Anthropic 在内部测试中,把一家上市公司的季度财报材料、电话会议记录和幻灯片模板交给 Sonnet 5.5,让它制作一份10页的经营复盘。两位专家认为,交出的第一版已经可以直接发送。

不过对于更复杂、开放、需要长时间持续判断的工作,Anthropic 仍然认为 Opus 5.5 明显更强。Sonnet 5.5 的主要位置,还是修 bug、改页面、做文档这些范围比较明确的日常任务。

◈输出速度快了30%,单价没变

Sonnet 5.5 的输出生成速度,比上一代快了30%以上。Anthropic 称,这是目前最快的 Sonnet。

Claude Code 负责人 Boris Cherny 分享了一组修 bug 的对照演示。

两个模型面对同一个代码仓库,里面有四个失败的测试。它们需要读取、搜索、修改代码,直到测试通过,而且不能通过修改测试来“过关”。

Boris 给出的结果是:快30%,token用量少30%。

另外官网的沙丘案例,给两代模型出了同一道题:用一个 HTML 文件,模拟风塑造沙丘的过程。

在官方对照演示中,Sonnet 5.5 先写完代码,画面里的沙粒已经随风移动,沙丘轮廓也开始变化,Sonnet 5 还在继续生成代码。这次案例中,新版输出了2720个 token,旧版为3088个,减少了约12%。

速度之外,花费也值得一起看。

Sonnet 5.5 的 token 单价与 Sonnet 5 相同:每百万输入 token 2 美元,输出 token 10 美元,缓存读取 0.20 美元。

这次降本,主要来自用量减少。

Anthropic 表示,新模型通常能用更少的 token 完成同样的工作;在其测试中,多数工作的单任务成本最多降低30%。

◈现已上线,附官方上手指南

Sonnet 5.5 现在已经进入 Claude 应用、Claude Code、API,以及 AWS、Google Cloud 和 Microsoft Azure 等平台。

普通用户可以先打开 Claude 的模型选择器,查看账号是否已经出现 Sonnet 5.5。

开发者通过 API 使用时,模型名为 claude-sonnet-5-5,支持 1M 上下文和最高 128K 输出。

对于准备把它放进日常工作流的人,官方还发布了一篇完整的 《Building with Claude Sonnet 5.5》构建指南,由 Anthropic 的 工程师 Addy Osmani 撰写,覆盖模型选择、推理档位、Claude Code 使用和旧项目迁移。

其中几条建议可以直接用起来。

Claude Code 用户,先更新,再切换模型。官方指南说明,从 v2.1.284 起,在 Claude API 路径下,输入 /model sonnet 即可切换到 Sonnet 5.5。

日常编程可以从 Medium 开始。任务更复杂、执行时间更长时,再考虑提高到 High。Xhigh、Max 是否值得开,取决于它们能否在自己的任务上带来实际收益。

把任务和验收标准讲清楚。例如要修改哪些功能、哪些测试必须通过、什么情况算完成。这样模型才有明确的完成目标。

Sonnet 5.5 这次升级,让日常用的“中杯”又往旗舰靠近了一步,出结果更快,同样的活也有机会少花点钱。

目前Claude 5.5 家族还差最后一位。按照 Anthropic 的预告,Haiku 5.5 将在未来几周加入。

大杯、中杯已经亮相,接下来就看“小杯”能带来多少惊喜了。

文章标签模型发布
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多