Token导航 LogoToken导航

Anthropic 发布 Claude Sonnet 5.5 速度提升 30%

更新时间 2026-09-29来源 AGIHunt正文 3410字阅读约 11分钟9 张图片

刚刚,Anthropic 发布了 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二个模型。

图片

距离上周 Opus 5.5 的发布,刚好过去了一周。

图片
Sonnet 5.5 官宣

Claude 的官宣推文中写道:

“

相比 Sonnet 5,这是一次明确的升级:速度快了 30% 以上,大多数工作的成本最多降低 30%。

价格则和 Sonnet 5 保持一致,输入 $2、输出 $10(每百万 token),正好是 Opus 5.5 的一半。

而这个价格,也和上周刚发布的 GPT-6 Sol 一毛一样……

跑分贴着 Opus 5.5

01

先来看官方的 benchmark 表:

图片
官方 benchmark

最离谱的当属 Terminal-Bench 4.0:Sonnet 5 只有 10.3%,而 Sonnet 5.5 直接干到了 70.6%,反超了自家大哥 Opus 5.5 的 66.4%。

要知道,Opus 5.5 的这个成绩,已经是它开 Xhigh 时的最高分了。

看图表的 Chartography 也类似,从 15.6% 涨到了 61.6%,差不多翻了四倍。

知识工作的两项里,GDPval-AA 上 Sonnet 5.5 拿到了 1844 分,和 Opus 5.5 的 1846 只差 2 分。OSWorld 的 computer use 上是 80.1% 对 81.8%,CursorBench 上是 55.5% 对 57.8%,也基本是贴着走的。

而同价位的 GPT-6 Sol,在两项知识工作和 Chartography 上都落后了 Sonnet 5.5 一大截,只有 FrontierCode 的 49.3% 比 Sonnet 5.5 开 Max 时要高(但不如开 Xhigh 时的 52.1%)。

怎么说呢,一半价格的 Sonnet 5.5,在多数项目上几乎和 Opus 5.5 性能相当。

官方给它的定位,是 Opus 5.5 的一个更快、更便宜的搭档,最擅长的是范围明确的日常任务、修 bug,以及做出精致的文档、幻灯片和表格。

快 30%,也更省 token

02

Sonnet 5.5 的单价虽然没降,但干同样的活,需要的 token 要少得多。在官方的测试中,单个任务的成本比 Sonnet 5 最多能低 30%。

输出速度也同样快了 30% 以上,是 Anthropic 迄今为止最快的 Sonnet 模型。

官方放了一段速度对比,让 Sonnet 5 和 Sonnet 5.5 同时写一个 boids 鸟群模拟:

图片
速度对比

Sonnet 5.5 用了 4,158 个 token 先写完,鸟群已经飞起来了,这时 Sonnet 5 还在一行行往下写代码,最后多花了将近 500 个 token 才完工。

等到 Sonnet 5 的鸟群开飞,Sonnet 5.5 那边已经飞了 13 秒多……

早期客户给出的数字,也是同样的反馈:

Balyasny 资产管理:金融类任务中,Sonnet 5.5 每个回答大约用 12.1 万 token,Sonnet 5 则要 49.7 万。

Box:速度快了 2.4 倍,总 token 少了 12%,找出原始文档里错误的准确率也更高。

Slack:离线评测中超过了 Sonnet 5,用的步数更少,输出 token 也少了约 14%。

Zendesk:工单处理快了 20%,错误决策也更少。

Atlassian:Rovo Agents 换上 Sonnet 5.5 后,最多快了 30%。

Epic Games:在动辄数万行代码的系统设计审计、数据流审查上,达到了「你对更高档模型才会有的质量标准」。

低 effort 打赢 Sonnet 5 满配

03

更夸张的一组数据,是关于 effort 档位。官方称:

“

在多个 benchmark 上,Sonnet 5.5 开 Low 或 Medium,就能以大约十分之一的成本,超过 Sonnet 5 的最好成绩。

Sonnet 5.5 提供 Low、Medium、High、Xhigh、Max 五档 effort,Claude 应用里默认是 Medium,Claude Platform 上默认则是 High。

effort 到底调的是什么,可以看我前两天的那篇 Claude Code 官方博客:Claude Code Thariq:如何设置不同模型的 effort?

先看知识工作的 AA-Briefcase:

图片
知识工作 effort 曲线

Sonnet 5 开到最高档,每个任务大约要花 14 美元,Elo 在 1360 上下;而 Sonnet 5.5 只开 Medium,每个任务 1.6 美元左右,Elo 就已经到了 1460 附近。

CursorBench 4.0 上更直观,Sonnet 5.5 最低的 Low 档(每个任务约 0.5 美元)就有 36% 左右,已经超过了 Sonnet 5 满配的 34.1%:

图片
CursorBench effort 曲线

Terminal-Bench 4.0 也是如此,Low 档的 20% 左右,就已经是 Sonnet 5 最高分的两倍了。

图片
Terminal-Bench effort 曲线

而在 FrontierCode 这张图里,则有个挺好玩的小插曲:

图片
FrontierCode effort 曲线

Sonnet 5.5 开 Xhigh 能拿到 52.1%,开到 Max 反而掉到了 46.2%。

原因在于,FrontierCode 考的是代码改动能不能不经人工修改就直接合并,改了任务范围以外的东西,哪怕改得再好、再有帮助,也是要扣分的。

而开到 Max 的 Sonnet 5.5,会更频繁地去调用 Claude Code 的 code-review skill,把审查拆给一大堆 subagent 去做。结果在 Cognition 检查的两个案例里,要么是跑超时了,要么是多改了任务范围之外的代码……

活干多了,也是会被扣分的。

沙丘与宝可梦

04

Sonnet 5.5 另一个被官方拿出来说的,是设计能力:能给用户界面加上更多打磨,按模板做出来的幻灯片,基本也不太需要再改。

官方又放了一段对比,prompt 是「用一个 HTML 文件做出风吹沙丘」:

图片
沙丘对比

Sonnet 5 画出来的是几条平滑的曲线,Sonnet 5.5 则多了一轮红日,沙丘也有了陡峭的落沙坡和阴影线条,画面讲究了不少。并且它还更早完工,少用了 368 个 token。

写作上,官方称 Sonnet 5.5 和 Opus 5.5 一样,比上一代模型写得更清楚。再加上速度快,很适合拿来快速迭代,以及在不那么复杂的任务上来回协作。

Anthropic 的 Alex Albert 也在 X 上表示:

“

Sonnet 5.5 有我喜欢 Opus 5.5 的那种感觉。它写得很清楚,非常快,能力相比 Sonnet 5 是一次大跃升。非常适合拿来迭代。

另外还有个小彩蛋:Sonnet 5.5 是第一个只靠截图,就通关了《宝可梦 红》的 Sonnet 模型。

安全与防蒸馏

05

在 Anthropic 的自动化行为审计中,Sonnet 5.5 在大多数对齐和诚实性指标上,都比 Sonnet 5 更好或者持平。

它也是第一个带有网络安全防护和兜底机制的 Sonnet,这套机制此前只用在 Anthropic 最强的几个模型上。日常的软件开发、调试不受影响,而风险较高的网络安全任务,则会回退给 Sonnet 5 来处理。做网络防御工作的团队,可以申请扩大后的 Cyber Verification Program(网络安全验证计划)。

生物安全方面,则沿用了 Sonnet 5 的那套防护,大多数科研、教育和临床工作不受影响,相关机构可以申请 Life Sciences Verification Program。

还有个有些朋友可能关心的,是防蒸馏。

Sonnet 5.5 是第一个配备了防推理提取安全分类器的 Sonnet 模型,同时扩大了 preserved thinking(保留思考)的范围,让思考内容没法脱离发起请求的账号被单独拿走。

A 社今年 2 月曾公开点名 DeepSeek 和 MiniMax 等一众国产模型公司对 Claude 发起了「工业级蒸馏攻击」,而这回,防蒸馏也终于下放到了 Sonnet 这一档。

可用性

06

Sonnet 5.5 今天已经全面上线,Claude 应用、Claude Code,以及 API(模型 ID claude-sonnet-5-5),同时登陆 AWS、Google Cloud 和 Microsoft Azure,支持零数据保留。

API 价格(每百万 token):

•  输入:$2 

•  输出:$10 

•  缓存读取:$0.20 

•  缓存写入:$2.50 

至于面向高并发、成本敏感场景的 Haiku 5.5,官方表示会在未来几周内发布。

评论区的网友们,则是一半在问 Haiku 呢,另一半在求再来一次额度重置……(上周 Opus 5.5 发布时刚送过一次,懂的都懂)

而如果你的 cc 额度常年告急,那最实在的用法,大概是把 Claude Code 里的 subagent 都换成 Sonnet 5.5,再让 Opus 5.5 来当指挥了。

◇ ◆ ◇

文章标签ClaudeAnthropic模型发布智能体应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多