刚刚,Anthropic 发布了 Claude Haiku 5.5,官方称这是他们迄今为止最便宜、最快、能力也最强的小模型。

Haiku 5.5 的平均运行成本,比上一代的 Haiku 4.5 低了约 75%。
而在便宜了这么多的同时,它在编码、computer use 和知识工作上的分数,又都比 Haiku 4.5 高出了一大截。
Anthropic 这次还一并宣布了另外两件事,一是 Sonnet 5.5 的缓存读取价格减半,二是 Claude Max 和 Team 订阅用户每个月会多出一笔 API 额度。
跑分
先来看官方给出的成绩单。

表里除了上一代的 Haiku 4.5,还拉来了 GPT-6 Luna 进行鞭打,最右边的 Sonnet 5.5 则仅供参考。
提升最大的是 computer use。在 OSWorld 2.1(离线子集)上,Haiku 5.5 拿到了 72.4%,而 Haiku 4.5 只有 15.7%,GPT-6 Luna 则是 48.9%。
Agentic coding 方面,Haiku 4.5 在 Terminal-Bench 4.0 上是直接交了白卷的,0.0%……而 Haiku 5.5 做到了 39.2%,GPT-6 Luna 为 16.4%。
Humanity's Last Exam 上,Haiku 5.5 不带工具时是 45.9%,带工具则有 57.4%,而上一代分别只有 10.2% 和 18.7%。
知识工作的 GDPval-AA v2.1 和 AA-Briefcase v1.1 两项,Haiku 5.5 分别拿了 1620 分和 1578 分,都是 Haiku 4.5(735 和 614)的两倍还多。
视觉推理的 Chartography 上,也从 6.4% 涨到了 46.4%。
当然,它和 Sonnet 5.5 之间还是有差距的。Terminal-Bench 4.0 上 Sonnet 5.5 是 70.6%,比 Haiku 5.5 高了三十多个点,复杂的 Agent 编码任务还是该交给 Sonnet 5.5 和 Opus 5.5。
Haiku 5.5 适合的是范围更窄一些的活,比如上下文压缩、摘要和 subagent,这些任务放在以前用 Claude 来跑,成本根本划不来。
可调 effort
Haiku 5.5 是第一个带 effort 设置的 Haiku 模型,一共有 Low、Med、High、Xhigh、Max 五档。
和 Claude 的其他模型一样,每个任务是要省钱还是要智能,都可以自己来定了。
官方放出了三张各档位的「分数 / 成本」曲线图。

OSWorld 上,Haiku 5.5 开到 Max 档之后是 72.4%,已经比 Sonnet 5.5 最低的那两档都要高了,而单次任务的花费还要更少一些。

GDPval-AA 上就没有这么好看了。在便宜的那几档里,GPT-6 Luna 花同样的钱拿到的分数还要略高一点,Haiku 5.5 是靠着 Xhigh 和 Max 两档才把分数给拉上去的。

Humanity's Last Exam 上,从 Xhigh 再往上加到 Max,分数就涨不太动了。
价格

Haiku 5.5 的定价按 prompt 长度分成了两档,以 10 万 token 为界。
每百万 token | 10 万以内 | 超过 10 万 | Haiku 4.5 |
|---|---|---|---|
输入 | $0.10 | $0.50 | $1.00 |
输出 | $0.50 | $2.50 | $5.00 |
缓存读取 | $0.01 | $0.05 | $0.10 |
缓存写入 | $0.125 | $0.625 | $1.25 |
算下来,10 万 token 以内的请求便宜了 90%,超过 10 万 token 的便宜了 50%。
而在 Haiku 4.5 上,大约有 90% 的请求都落在 10 万 token 以内。
那为什么平均下来只有 75% 呢?
官方在脚注里解释,这个平均数还把 token 用量的变化也算了进去。Haiku 5.5 换上了和 Sonnet 5.5、Opus 5.5 类似的新 tokenizer,干同样一件事会多用掉一些 token。
再和 Sonnet 5.5 比一下,后者的输入是 $2.00、输出是 $10.00。
10 万 token 以内的 Haiku 5.5,输入和输出的价格都只有它的二十分之一。
使用场景
Haiku 5.5 同时也是 Claude 目前最快的模型。不过脚注里也注明了,这是按各个模型的标准速度来比的,Opus 开了 Fast Mode 之后还是要更快。
官方给它安排的活,主要有这么几类。
• 摘要、上下文压缩、数据库查询、分类这种量大且重复的任务
• 编码时给 Opus 5.5 和 Sonnet 5.5 当 subagent
• 实时客服、浏览器操作这类对速度敏感的场景
几家提前拿到模型的公司也给出了各自的数据。
Asana 拿自家 Agent 产品 AI Teammates 的评测集跑了一遍,和他们现在在用的模型相比,任务完成的延迟降了 30% 以上,单轮推理速度最高是原来的 2.5 倍。
HubSpot 用模拟的 CRM 环境来测模型,Haiku 5.5 三次平均拿到了 92.8%,是这套评测上出现过的最高分。
AlphaSense 的文档问答功能,每周在生产环境里要调用约 800 万次。他们跑了 400 条查询,Haiku 5.5 得分 0.84,Haiku 4.5 是 0.76。
Box 的早期测试里,Haiku 5.5 比 Haiku 4.5 高了 11 分,延迟则只有一半左右。
Cognition 则把它加进了 Devin Fusion 的 sidekick 阵容。有 Haiku 5.5 当副手,Fusion 的 FrontierCode 得分还能保持在 66.2,成本和延迟也都降了下来。
现在在 Devin CLI 里就可以用上这个组合,由 Opus 5.5 来主导。
Rogo 的 Alex Wang 表示:
“更大的模型在做 deck 的时候,一个 Haiku 5.5 subagent 就钻进 10-K 里,把 deck 要用的分部营收那一行给找出来。它足够准,我们敢把这活交给它;也足够快、足够便宜,可以大量地跑。
安全
对齐评测上,Haiku 5.5 相比 Haiku 4.5 几乎是全面改进,失当行为少了很多,配合滥用的意愿也更低了。
防护措施方面,它在网络安全上比 Haiku 4.5 管得更严,但比近期的其他模型要松一些。
和 Sonnet 5.5 相比,它放行的防御类任务要更多一些,而渗透测试等更可能被攻击者用到的技术,仍然会被拦下。
生物方面的防护,则与 Sonnet 5、Sonnet 5.5 和 Opus 5 保持一致。
Sonnet 降价与 API 额度
Sonnet 5.5 的缓存读取价格,从每百万 token $0.20 降到了 $0.10。
缓存读取在 Agent 任务的 token 消耗里占了很大一块,所以降价之后,Sonnet 5.5 跑大多数 Agent 任务的成本会下降约 20%。
订阅用户专属的是,所有 Max 和 Team 订阅本周起每月会多一笔 API 额度,可以在 Claude Platform 上使用。
Max 5x 每月有 $100,Max 20x 每月 $200,Team 则是最高 $500,由团队成员共用。
这笔额度所有模型都能用,Anthropic 希望大家拿它来试着做些调用 API 的工具、应用和 Agent。
就是特么的不知道会不会封号,我刚封一个……
现在可用
Haiku 5.5 现在已经在所有平台上线,包括 AWS、Google Cloud 和 Microsoft Azure。
Claude Platform 上的模型 ID 是 claude-haiku-5-5。
◇ ◆ ◇
官方公告:https://www.anthropic.com/claude-haiku-5-5
官方推文:https://x.com/claudeai/status/2107894039626277339







