
Anthropic 刚刚发布了 Claude Opus 5.5,综合性能直接超越 Fable 5.1,日常运行成本却暴跌了 40%。

直接看几个测试,Opus 5.5的3d表现和GPT-6 Astra没什么区别,甚至更好
迪士尼模拟:
金门大桥模拟:
这是全新 Claude 5.5 家族上线的第一款基座模型。后续几周内,同系列的 Sonnet 5.5 和 Haiku 5.5 也会陆续推出。
这也是 Anthropic 公开呼吁放慢 AI 竞速节奏之后交出的第一份答卷。在正式推送前,它已经交由 METR 和 Frontier Design 等第三方机构完成了全方位的外部评估。
在针对模型行为的自动化对齐测试中,它拿下了迄今为止所有测试模型里的最高分。
在近 2000 个复杂模拟场景下接受了检验。面对越狱和提示词注入攻击,Opus 5.5 展现出了极高的防御水准。在安全机构 Gray Swan 的评测中,它的防注入表现并列行业第一。
在测试模型是否会突破权限边界的专项评估中,它试图违规越界的次数比上一代减少了大约 85%,而且所有被记录的行为全部属于低危害级别,模型还会主动进行自我报告。对于需要让 AI 长时间自主接管系统的开发者来说,这一点尤为关键。
相比上一代 Opus 5,Opus 5.5 带来了实质性的代际跨越,在自主编程、操作电脑(Computer Use)和复杂知识工作上全面领跑。
在代码能力上,它特别擅长处理超长周期、大规模的复杂工程
Opus 5.5 占用的底层计算资源大幅减少,定价策略也做了针对性的下调。
在默认设置下,处理常规任务的综合花费比 Opus 5 降低了整整 40%。它的输入和输出价格分别降至每百万 Token 4 美元和 20 美元,降幅达到 20%。
针对编程和 Agent 场景中占比最大的缓存读取,费用更是直接打到了每百万 Token 0.2 美元,降幅高达 60%。如果需要极致效率,官方在 Claude Code 和开发平台上还提供了 Fast 模式,生成速度可达 2.5 倍。

你根本不需要把它的思考参数拉到最高。在默认的工作强度下,Opus 5.5 就能交付前沿水准的结果,经常能直接击败其他竞品在满血档位下的表现。
一个奇怪的现象medium编程表现比xhigh还要好,所以大家知道用什么档位了吧

在 FrontierCode 基准测试中,默认状态的 Opus 5.5 击败了最高档位的 GPT-6 Astra,单次任务花费只有对方的 20% 左右。
在 Terminal Bench 4.0 测试中,它用 40% 的成本打平了 Astra。在 CursorBench 上,它领先 GPT-5.6 Sol 整整 11 分,花费却只要后者的三分之一。
在输出效率方面,它的文字生成速度也比 Opus 5 提升了 30% 以上。
Opus 5.5 说话的方式明显更自然,彻底解决了上代模型被频繁吐槽的表达生硬问题。
它会主动把最重要的结论甩在最前面,严格遵守用户给出的排版与写作要求,不再胡乱堆砌让人摸不着头脑的行业黑话。有早期测试者评价表示,它写出来的文字就像自己写的一样顺畅。
在需要连续沟通几十轮的深度工作流里,直白清晰的表达风格让用户省去了反复确认的力气,看一眼就能迅速抓住重点。
这一系列维度的升级,让 Opus 5.5 真正变成了一个能够长期稳定协作的干活搭档。
one more thing
最后还有一个实打实的福利更新:官方调高了 Pro、Max、Team 以及企业版订阅用户的 5 小时用量额度。所有付费订阅用户还会额外获得一次自主重置使用频率的机会,遇到额度受限时可以随时手动清零刷新。
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)







