Token导航 LogoToken导航

Anthropic发布Claude Opus 5.5 任务成本降40%

更新时间 2026-09-23来源 虎嗅网正文 4094字阅读约 13分钟8 张图片

新模型在多项编程测试中领先,同时调整写作风格与安全机制

本文来自微信公众号: 智东西 ,编译:杨京丽,编辑:李水青,作者:杨京丽,原文标题:《Anthropic深夜放大招:Claude Opus 5.5上线,任务成本大降40%》

订阅用户将获得一次使用限额重置机会。

智东西9月23日消息,今天凌晨,Anthropic发布Claude Opus 5.5,这是Claude 5.5系列的首款模型。Anthropic称,新模型在多数任务上的表现与Claude Fable 5.1相当,默认设置下的典型任务成本较上一代Opus 5降低40%,输出速度提升超过30%。

在官方公布的9项测试中,Opus 5.5有7项成绩领先Fable 5.1、Opus 5、GPT-6 Astra和GPT-5.6 Sol。其中,Opus 5.5在三项编程测试中均取得最高分,但在业务流程和科研Agent测试中仍落后于GPT-6 Astra。

在第三方评测机构Artificial Analysis的Intelligence榜单上,Claude Opus 5.5以58分位列第一,领先Claude Fable 5.1和GPT-6 Astra的53分。

具体任务中,Anthropic披露,Opus 5.5用9.5小时完成了将负载均衡软件HAProxy从C语言改写为Rust的任务,成本比Fable 5.1低51%;在要求逐一核对数字和引语的财报研究测试中,其生成的18份报告有16份达标,Fable 5.1和Opus 5则均未通过。此外,一名早期测试者使用Opus 5.5,不到一天完成了涉及68万行代码的迁移。

价格方面,Opus 5.5每百万输入、输出Token分别收费4美元(约合人民币26.8元)和20美元(约合人民币134元),较Opus 5下调20%;缓存读取价格较Opus 5下降60%。与此同时,Anthropic提高了多个付费套餐的五小时使用额度,并向订阅用户提供一次可自行选择使用时间的额度重置机会。

Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台。不过,部分专业任务仍受安全机制限制,例如大多数网络安全任务会被转交Opus 4.8处理。Claude Sonnet 5.5和Claude Haiku 5.5计划在未来几周推出。

Claude Opus 5.5发布近2个小时后,OpenAI也推出了GPT-6 Sol和GPT-6 Luna,GPT-6“宇宙”加入新成员。

01.

编程成绩超过Fable 5.1、GPT-6 Astra,

输入输出价格下调20%

Anthropic公布了Opus 5.5与4款模型在9项测试中的成绩,对比对象包括Fable 5.1、Opus 5,以及OpenAI的GPT-6 Astra和GPT-5.6 Sol。9项测试中,Opus 5.5有7项得分最高。

智能体编程方面,Opus 5.5在Terminal-Bench 4.0、FrontierCode v1.1和CursorBench 4.0上分别得到66.4%、54.4%和57.8%,三项都是对比模型中最高。

在业务流程测试AutomationBench和科研Agent测试Terminal-Bench-Science 0.1中,其成绩低于GPT-6 Astra。

价格方面,Opus 5.5每百万输入Token收费4美元(约合人民币26.8元),每百万输出Token收费20美元(约合人民币134元),均较Opus 5下降20%。

Claude Code和Claude Platform还提供Opus 5.5快速模式,Anthropic称其速度最高可达普通模式的2.5倍。该模式每百万输入、输出Token分别收费8美元(约合人民币53.6元)和40美元(约合人民币268元)。

02.

9.5小时完成代码改写,

财报测试18份报告中16份达标

编程方面,Anthropic重点展示了代码迁移、代码库审查和性能优化等长时间任务。

Anthropic称,一名早期测试者使用Opus 5.5,在不到一天内完成了涉及68万行代码的迁移。另一名测试者对一个20万行代码库进行审查和修复,Opus 5.5用时不到3小时;Opus 5完成该任务则超过20小时,消耗的Token是前者的2.5倍。

在内部测试中,Anthropic要求Opus 5.5和Fable 5.1将负载均衡软件HAProxy从C语言改写为Rust。两者改写后的版本均通过了HAProxy自身几乎全部回归测试。Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。

另一项网页性能优化测试要求模型降低一个Web应用所有页面的加载时间。Opus 5.5在40次测试中成功39次。Anthropic称,Opus 5的优化幅度较小,且改变了应用原有行为。

Anthropic还比较了不同推理强度下的任务成本。Anthropic称,在默认推理强度下,Opus 5.5在FrontierCode上的成绩超过GPT-6 Astra,单次任务成本约为后者的20%;在Terminal-Bench 4.0上达到相近成绩时,成本约为后者的40%。这些比例对应特定测试设置,不能直接等同于所有实际开发任务的费用差异。

知识工作方面,Opus 5.5在覆盖44种职业任务的GDPval-AA v2.1中取得1846分,高于Fable 5.1的1735分和Opus 5的1708分。

Anthropic还设计了一项财报研究测试:模型只能在一个财报公告较难找到的网页副本环境中检索资料,并据此撰写公司季度业绩报告。自动评分程序会逐一核对报告中的数字和引语,任何编造都会导致不达标。

在不同推理强度下,Opus 5.5生成的18份报告中有16份通过质量门槛,Fable 5.1和Opus 5则未有报告通过。

另一项测试中,Anthropic要求模型分析两家虚构人力资源软件公司的并购交易,先用Excel建立财务模型,再生成面向管理层的演示文稿。Opus 5.5与Opus 5得出了相同的交易判断,但前者用时63分钟,后者用时93分钟,前者成本低50%。Anthropic认为,Opus 5.5的财务模型更完整,演示文稿更易读,Opus 5的结果则存在少量错误。

03.

回答更简洁,

越界尝试降低85%

除了任务执行能力,Anthropic还调整了Opus 5.5的写作与沟通方式,包括优先呈现关键信息、减少术语和不常见表达,以及更好地遵循用户指定的写作规则。

在官方展示案例中,两个模型被要求解释同一个问题,某客户8月的账单金额为什么出现了额外的下降。Opus 5.5在第一句话中能够直接给出结论,“计费系统重构导致月末账单出现漏计”,再解释代码边界条件如何产生错误。从篇幅来看,Opus 5.5的回答也更简洁。

安全方面,Anthropic称,Opus 5.5发布前接受了METR、Frontier Design等外部机构评估。在覆盖近2000个模拟场景的自动化行为审计中,其在几乎所有受测的不对齐行为指标上优于近期Claude模型。

在一项测试模型是否试图突破隔离边界的新评估中,Opus 5.5尝试绕过边界的频率,较Opus 5或Claude Mythos 5.1降低约85%。按照官方描述,Opus 5.5出现的相关尝试均被评为低严重程度,且模型自行报告了这些行为。

提示词注入方面,Anthropic称,Opus 5.5在编程、工具调用、计算机操作和网页浏览等受测场景中的防御表现不弱于Opus 5。在AI安全公司Gray Swan开展的一项测试中,Opus 5.5与Fable 5.1并列取得受测模型中最低的提示词注入攻击成功率。

不过,Anthropic同时承认,部署前评估仍无法可靠发现所有失效情况。测试中,Opus 5.5经常疑似意识到自己正接受评估,这会增加判断其真实部署行为的难度。

针对后续模型,Anthropic计划加强强化学习训练环境筛选、调整对齐奖励、增加安全训练场景,并改进基于可解释性的监控和评估,减少对模型所写思维链的依赖。这些属于后续安全工作方向,并非已经验证有效的结果。

04.

部分安全任务转交旧模型,

订阅额度同步提高

Opus 5.5此次上线附带了与Fable 5.1类似的网络安全、生物学和反蒸馏防护机制。触发相关限制时,请求会转交其他模型处理。

网络安全方面,用户仍可在日常软件开发中查找和修复代码漏洞,但大多数网络安全任务会被转交Opus 4.8。Anthropic计划在未来几周扩大网络安全验证计划,将Opus 5.5纳入其中,并设置三个不同权限等级,部分等级可使用Claude Mythos模型。

生物研究方面,Anthropic称,Opus 5.5在多个任务上的能力达到或超过Claude Mythos 5.1,因此采用了与Fable 5.1相同的生物学防护措施。受相关限制影响的学术实验室、初创公司和药企,可申请生命科学验证计划,经审核后获得适用于更广泛生物研究工作的访问权限。

反蒸馏方面,Opus 5.5启用了“保留思考”(preserved thinking)机制,限制API用户通过修改Claude此前上下文来提取模型推理。该机制适用于2026年8月31日及之后创建的API账户,覆盖Fable 5.1和Opus 5.5。

数据处理方面,Opus 5.5继续提供零数据保留选项,并加入Anthropic所称用于满足欧盟《人工智能法案》要求的水印措施。同时,该模型不再提供关闭思考模式的选项。

Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台,开发者可通过模型标识claude-opus-5-5调用。

订阅方面,Anthropic提高了Pro、Max、Team及按席位计费的Enterprise套餐的五小时使用额度。订阅用户还将获得一次使用限额重置机会,可保留至需要时使用。

05.

结语:长任务的效率与

成本成为升级重点

Opus 5.5此次更新的主要变化,是在提高部分编程和知识工作测试成绩的同时,也着重降低了完成任务所需的时间和费用。对于需要持续运行的Agent,这些变化直接关系到实际使用成本。

不过,官方测试中的优势能否延续到真实业务中,还取决于任务复杂度、结果准确性,以及安全限制对任务执行的影响。

文章标签ClaudeAnthropic模型发布智能体安全
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多