Token导航 LogoToken导航

Anthropic 发布 Claude Haiku 5.5 降价75%跑分提升

更新时间 2026-10-08来源 AGIHunt正文 3016字阅读约 10分钟7 张图片

刚刚,Anthropic 发布了 Claude Haiku 5.5,官方称这是他们迄今为止最便宜、最快、能力也最强的小模型。

图片
Claude Haiku 5.5

Haiku 5.5 的平均运行成本,比上一代的 Haiku 4.5 低了约 75%。

而在便宜了这么多的同时,它在编码、computer use 和知识工作上的分数,又都比 Haiku 4.5 高出了一大截。

Anthropic 这次还一并宣布了另外两件事,一是 Sonnet 5.5 的缓存读取价格减半,二是 Claude Max 和 Team 订阅用户每个月会多出一笔 API 额度。

跑分

01

先来看官方给出的成绩单。

图片
Haiku 5.5 跑分

表里除了上一代的 Haiku 4.5,还拉来了 GPT-6 Luna 进行鞭打,最右边的 Sonnet 5.5 则仅供参考。

提升最大的是 computer use。在 OSWorld 2.1(离线子集)上,Haiku 5.5 拿到了 72.4%,而 Haiku 4.5 只有 15.7%,GPT-6 Luna 则是 48.9%。

Agentic coding 方面,Haiku 4.5 在 Terminal-Bench 4.0 上是直接交了白卷的,0.0%……而 Haiku 5.5 做到了 39.2%,GPT-6 Luna 为 16.4%。

Humanity's Last Exam 上,Haiku 5.5 不带工具时是 45.9%,带工具则有 57.4%,而上一代分别只有 10.2% 和 18.7%。

知识工作的 GDPval-AA v2.1 和 AA-Briefcase v1.1 两项,Haiku 5.5 分别拿了 1620 分和 1578 分,都是 Haiku 4.5(735 和 614)的两倍还多。

视觉推理的 Chartography 上,也从 6.4% 涨到了 46.4%。

当然,它和 Sonnet 5.5 之间还是有差距的。Terminal-Bench 4.0 上 Sonnet 5.5 是 70.6%,比 Haiku 5.5 高了三十多个点,复杂的 Agent 编码任务还是该交给 Sonnet 5.5 和 Opus 5.5。

Haiku 5.5 适合的是范围更窄一些的活,比如上下文压缩、摘要和 subagent,这些任务放在以前用 Claude 来跑,成本根本划不来。

可调 effort

02

Haiku 5.5 是第一个带 effort 设置的 Haiku 模型,一共有 Low、Med、High、Xhigh、Max 五档。

和 Claude 的其他模型一样,每个任务是要省钱还是要智能,都可以自己来定了。

官方放出了三张各档位的「分数 / 成本」曲线图。

图片
OSWorld 各档表现

OSWorld 上,Haiku 5.5 开到 Max 档之后是 72.4%,已经比 Sonnet 5.5 最低的那两档都要高了,而单次任务的花费还要更少一些。

图片
GDPval-AA 各档表现

GDPval-AA 上就没有这么好看了。在便宜的那几档里,GPT-6 Luna 花同样的钱拿到的分数还要略高一点,Haiku 5.5 是靠着 Xhigh 和 Max 两档才把分数给拉上去的。

图片
HLE 各档表现

Humanity's Last Exam 上,从 Xhigh 再往上加到 Max,分数就涨不太动了。

价格

03
图片
价格表

Haiku 5.5 的定价按 prompt 长度分成了两档,以 10 万 token 为界。

每百万 token
10 万以内
超过 10 万
Haiku 4.5
输入
$0.10
$0.50
$1.00
输出
$0.50
$2.50
$5.00
缓存读取
$0.01
$0.05
$0.10
缓存写入
$0.125
$0.625
$1.25

算下来,10 万 token 以内的请求便宜了 90%,超过 10 万 token 的便宜了 50%。

而在 Haiku 4.5 上,大约有 90% 的请求都落在 10 万 token 以内。

那为什么平均下来只有 75% 呢?

官方在脚注里解释,这个平均数还把 token 用量的变化也算了进去。Haiku 5.5 换上了和 Sonnet 5.5、Opus 5.5 类似的新 tokenizer,干同样一件事会多用掉一些 token。

再和 Sonnet 5.5 比一下,后者的输入是 $2.00、输出是 $10.00。

10 万 token 以内的 Haiku 5.5,输入和输出的价格都只有它的二十分之一。

使用场景

04

Haiku 5.5 同时也是 Claude 目前最快的模型。不过脚注里也注明了,这是按各个模型的标准速度来比的,Opus 开了 Fast Mode 之后还是要更快。

官方给它安排的活,主要有这么几类。

•  摘要、上下文压缩、数据库查询、分类这种量大且重复的任务 

•  编码时给 Opus 5.5 和 Sonnet 5.5 当 subagent 

•  实时客服、浏览器操作这类对速度敏感的场景 

几家提前拿到模型的公司也给出了各自的数据。

Asana 拿自家 Agent 产品 AI Teammates 的评测集跑了一遍,和他们现在在用的模型相比,任务完成的延迟降了 30% 以上,单轮推理速度最高是原来的 2.5 倍。

HubSpot 用模拟的 CRM 环境来测模型,Haiku 5.5 三次平均拿到了 92.8%,是这套评测上出现过的最高分。

AlphaSense 的文档问答功能,每周在生产环境里要调用约 800 万次。他们跑了 400 条查询,Haiku 5.5 得分 0.84,Haiku 4.5 是 0.76。

Box 的早期测试里,Haiku 5.5 比 Haiku 4.5 高了 11 分,延迟则只有一半左右。

Cognition 则把它加进了 Devin Fusion 的 sidekick 阵容。有 Haiku 5.5 当副手,Fusion 的 FrontierCode 得分还能保持在 66.2,成本和延迟也都降了下来。

现在在 Devin CLI 里就可以用上这个组合,由 Opus 5.5 来主导。

Rogo 的 Alex Wang 表示:

“

更大的模型在做 deck 的时候,一个 Haiku 5.5 subagent 就钻进 10-K 里,把 deck 要用的分部营收那一行给找出来。它足够准,我们敢把这活交给它;也足够快、足够便宜,可以大量地跑。

安全

05

对齐评测上,Haiku 5.5 相比 Haiku 4.5 几乎是全面改进,失当行为少了很多,配合滥用的意愿也更低了。

防护措施方面,它在网络安全上比 Haiku 4.5 管得更严,但比近期的其他模型要松一些。

和 Sonnet 5.5 相比,它放行的防御类任务要更多一些,而渗透测试等更可能被攻击者用到的技术,仍然会被拦下。

生物方面的防护,则与 Sonnet 5、Sonnet 5.5 和 Opus 5 保持一致。

Sonnet 降价与 API 额度

06

Sonnet 5.5 的缓存读取价格,从每百万 token $0.20 降到了 $0.10。

缓存读取在 Agent 任务的 token 消耗里占了很大一块,所以降价之后,Sonnet 5.5 跑大多数 Agent 任务的成本会下降约 20%。

订阅用户专属的是,所有 Max 和 Team 订阅本周起每月会多一笔 API 额度,可以在 Claude Platform 上使用。

Max 5x 每月有 $100,Max 20x 每月 $200,Team 则是最高 $500,由团队成员共用。

这笔额度所有模型都能用,Anthropic 希望大家拿它来试着做些调用 API 的工具、应用和 Agent。

就是特么的不知道会不会封号,我刚封一个……

现在可用

07

Haiku 5.5 现在已经在所有平台上线,包括 AWS、Google Cloud 和 Microsoft Azure。

Claude Platform 上的模型 ID 是 claude-haiku-5-5。

◇ ◆ ◇

官方公告:https://www.anthropic.com/claude-haiku-5-5

官方推文:https://x.com/claudeai/status/2107894039626277339

文章标签ClaudeAnthropic模型发布价格调整安全
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多