Opus 5.5 发布还没满一周,Anthropic 又把自家的“中杯”更新了。
今天凌晨,Claude Sonnet 5.5 正式发布。
在 Terminal-Bench 4.0 编程评测中,成绩从上一代的 10.3% 提高到 70.6%,超过了大杯模型 Opus 5.5 。
与Sonnet 5相比,完成多数工作时,Sonnet 5.5 需要的 token 更少,单任务成本最多降低30%。
◈多项成绩逼近旗舰
先看这次的榜单,Sonnet 5.5 在编程能力的提升最明显。
在考察命令行多步骤任务的 Terminal-Bench 4.0 上,Sonnet 5.5 的 Max 档拿到了70.6%,超过了Opus 5.5 的66.4%。作为对照,Sonnet 5 的最高分是10.3%,
然后是 FrontierCode ,它考察的更接近代码交付:模型提交的修改,能不能不经人工改动就直接合并。
同样开到 High 档,Sonnet 5.5 得分49.4%,Sonnet 5 是39.4%。高了10个百分点,单任务成本约为上一代的十五分之一。
这个档位的成绩,也基本追平了 GPT-6 Sol 的最高分49.3%,成本约为其五分之一。
不过,档位并非越高越好。Sonnet 5.5 在这项评测中的最高分出现在 Xhigh,为52.1%;拉到 Max,反而降到了46.2%。
来自真实 Cursor 会话的 CursorBench 4.0,测试的是需求不完全明确、涉及多个文件的编程任务。
Sonnet 5.5 的最高分达到55.5%,上一代为34.1%,Opus 5.5 为57.8%,与旗舰的差距缩小到了2.3个百分点。
而在 Low 档,Sonnet 5.5 就拿到了35.8%,超过上一代 Max 档的34.1%,单任务成本同样不到后者的十分之一。
编程之外,知识工作的成绩也追了上来。
在覆盖多个行业和职业任务的 GDPval-AA 中,Sonnet 5.5 的 Elo 得分为1844,Opus 5.5 为1846,只差2分。
另一项 AA-Briefcase v1.1 测的是需要持续推进的长流程知识工作。Sonnet 5.5 的最高 Elo 得分为1811,上一代是1359,Opus 5.5 则是1822。
开到 Medium 档,Sonnet 5.5 得分1461,已经超过上一代 Max 档的1359,而单任务成本约为后者的九分之一。
第三方榜单也给出了相近的结果。
在 Artificial Analysis 的综合智能指数中,Sonnet 5.5 拿到56分,上一代 Sonnet 5 为38分。
按各模型系列的最高配置比较,它排到了第二,仅次于58分的 Opus 5.5;GPT-6 Astra 和 GPT-6 Sol 的整数分分别为53和48。
这些提升,官方也展示了比较直观的例子。
Anthropic 在内部测试中,把一家上市公司的季度财报材料、电话会议记录和幻灯片模板交给 Sonnet 5.5,让它制作一份10页的经营复盘。两位专家认为,交出的第一版已经可以直接发送。
不过对于更复杂、开放、需要长时间持续判断的工作,Anthropic 仍然认为 Opus 5.5 明显更强。Sonnet 5.5 的主要位置,还是修 bug、改页面、做文档这些范围比较明确的日常任务。
◈输出速度快了30%,单价没变
Sonnet 5.5 的输出生成速度,比上一代快了30%以上。Anthropic 称,这是目前最快的 Sonnet。
Claude Code 负责人 Boris Cherny 分享了一组修 bug 的对照演示。
两个模型面对同一个代码仓库,里面有四个失败的测试。它们需要读取、搜索、修改代码,直到测试通过,而且不能通过修改测试来“过关”。
Boris 给出的结果是:快30%,token用量少30%。
另外官网的沙丘案例,给两代模型出了同一道题:用一个 HTML 文件,模拟风塑造沙丘的过程。
在官方对照演示中,Sonnet 5.5 先写完代码,画面里的沙粒已经随风移动,沙丘轮廓也开始变化,Sonnet 5 还在继续生成代码。这次案例中,新版输出了2720个 token,旧版为3088个,减少了约12%。
速度之外,花费也值得一起看。
Sonnet 5.5 的 token 单价与 Sonnet 5 相同:每百万输入 token 2 美元,输出 token 10 美元,缓存读取 0.20 美元。
这次降本,主要来自用量减少。
Anthropic 表示,新模型通常能用更少的 token 完成同样的工作;在其测试中,多数工作的单任务成本最多降低30%。
◈现已上线,附官方上手指南
Sonnet 5.5 现在已经进入 Claude 应用、Claude Code、API,以及 AWS、Google Cloud 和 Microsoft Azure 等平台。
普通用户可以先打开 Claude 的模型选择器,查看账号是否已经出现 Sonnet 5.5。
开发者通过 API 使用时,模型名为 claude-sonnet-5-5,支持 1M 上下文和最高 128K 输出。
对于准备把它放进日常工作流的人,官方还发布了一篇完整的 《Building with Claude Sonnet 5.5》构建指南,由 Anthropic 的 工程师 Addy Osmani 撰写,覆盖模型选择、推理档位、Claude Code 使用和旧项目迁移。
其中几条建议可以直接用起来。
Claude Code 用户,先更新,再切换模型。官方指南说明,从 v2.1.284 起,在 Claude API 路径下,输入 /model sonnet 即可切换到 Sonnet 5.5。
日常编程可以从 Medium 开始。任务更复杂、执行时间更长时,再考虑提高到 High。Xhigh、Max 是否值得开,取决于它们能否在自己的任务上带来实际收益。
把任务和验收标准讲清楚。例如要修改哪些功能、哪些测试必须通过、什么情况算完成。这样模型才有明确的完成目标。
Sonnet 5.5 这次升级,让日常用的“中杯”又往旗舰靠近了一步,出结果更快,同样的活也有机会少花点钱。
目前Claude 5.5 家族还差最后一位。按照 Anthropic 的预告,Haiku 5.5 将在未来几周加入。
大杯、中杯已经亮相,接下来就看“小杯”能带来多少惊喜了。







