同事之间,最重要的是什么?诚信。
当AI真的要变成你的同事时,它的诚信甚至比能力更重要。知之为知之,不知为不知,是知也。
否则的话,幻觉、隐瞒或伪造结果,都可能在后续工作流中积累放大,造成难以清除的技术债。在实际工作中,不诚信的同事,企业也是不敢用的。
Anthropic称,Claude Opus 4.8的发布,“最显著的改进之一是其诚实性”。
同一天,Anthropic还官宣了650亿美元融资完成。这家全球估值最高的AI初创公司,将其技术路径与商业路径的前沿,同时向前推进了一大步。
在融资声明中,Anthropic特别强调了来自亚马逊等超大规模云服务商此前承诺的战略投资,及其锁定的覆盖未来数年的、超过10GW的算力合作。与此同时,美光、三星与SK海力士等存储巨头,也首次以“战略基础设施伙伴”的身份,被写入声明之中。
这并不仅仅是一份融资名单,更像是一份AI基础设施联盟名单。年初至今,Anthropic深陷算力短缺,其模型迭代与客户扩张,都受到推理资源的制约。而Opus 4.8及其harness环境的持续演进,又将进一步推高整体推理资源的消耗规模。一旦这一瓶颈逐步缓解,Anthropic的年化收入(ARR)有望继续从当前的470亿美元进一步跃升。

Anthropic正在推动一种新的AI扩展路径,而它的资金使用效率,显然也比OpenAI更高。在更少融资规模下,Anthropic已经在企业编码市场形成强势渗透,并在ARR与估值上双双反超。
距离Opus 4.7发布,仅过去40天。相比此前几代模型,Opus 4.8的进步,并不主要体现在基准测试成绩的跃升上。无论是在智能体编码基准SWE-bench Pro,还是智能体电脑操作基准OSWorld-Verified,它的成绩都只是小幅刷新。
Anthropic真正强调的,是“诚实性”。当任务存在未通过的测试、未实现的功能或潜在逻辑漏洞时,Opus 4.8会更倾向于主动暴露问题,而非像过去那样直接提交错误结果;当缺少工具、附件或必要权限时,它也减少了“假装执行”并编造输出的情况。

这对于AI真正嵌入现实工作流至关重要。随着模型能够完成的任务链条越来越长,AI与人类之间的协作关系,已经转向了“共事”。诚信是一起共事的基本前提。
在这种情况下,“诚实”会成为决定AI能否进入企业核心流程的关键能力。因为任务执行周期一旦被拉长,任何一次幻觉、隐瞒或伪造结果,都可能在后续工作流中被层层放大。一个能连续工作十几个小时,却偶尔偷偷提交错误代码、凭空编造输出的AI,只会制造更难清除的“技术债”。
这种“诚实”的背后,可能指向一种更深层的能力迁移。
Anthropic没有直接解释其来源,但此前在阐释Opus 4.6的可靠性提升时,他们曾揭示过一个关键逻辑:在Opus 4.5时代,为了维持长链智能体任务的稳定运行,系统往往需要依赖复杂的任务拆解、频繁的评估器介入,以及大量外部harness来纠偏。而到了Opus 4.6,模型本身已经更擅长在大型代码库中长时间稳定工作,也更能够自主完成代码审核、错误定位与Bug修复,于是,团队主动拆除了之前至关重要的脚手架。
前沿模型与harness之间,或许是一种递归进化关系。当前一代harness负责补足同期模型能力的缺陷,而下一代模型,则会逐步将上一代harness中的部分能力内化。与此同时,更复杂的新任务,又会催生出下一代更庞大的harness体系。
在这个过程中,真实工作流中的反馈,会持续淘汰无效结构,并将那些被证明有效的执行逻辑,逐渐沉淀进模型本身。
换句话说,AI能力的增长,早已不再只是参数规模与预训练数据扩展那么简单,而开始演变为“模型—工作流—工具链”的协同进化。
真正决定AI商业价值的,也不再是模型在基准测试上提高了多少分,而是它能否真正进入现实生产系统,减少为短期交付而累积的技术债务,以及复杂组织流程中的摩擦成本。ROI的提升,往往就发生在两种债务被持续清偿的时刻。
Anthropic比谁都更早进入这个循环。去年年底至今,Claude系列模型的稳定性持续迭代增强,在企业市场中的实际部署“史无前例”地快速攀升,并逐渐掌握了Coding领域最强的话语权。如今,它已经成为估值9650亿美元的全球最大AI初创企业。
而它的前沿模型与harness协同进化的飞轮,仍在加速运转。
这一次,伴随Opus 4.8到来的,是Claude Code的动态工作流(dynamic workflows)。系统会根据提示词动态生成编排脚本,将任务拆解为多个子任务,分发给数百个并行运行的子智能体。不同智能体从独立视角尝试解决问题,其他智能体则对这些结论进行交叉验证与反驳,整个过程持续迭代,直到最终收敛为一致的结果。
它们能够胜任那些过去可能需要工程团队耗费数周才能完成的复杂任务。而且,由于运行中实时保存进度,即便任务意外中断,也能够从断点处无缝恢复,而不必重新开始。
正因如此,即便Claude Opus系列模型的推理效率持续提高,整体任务Claude Code消耗的token数量仍在快速上升。
事实上,据Artificial Analysis测评,仅就Opus 4.8模型本身而言,它的token效率其实已经优于Opus 4.7:在完成GDPval-AA测评任务时,所需轮次减少了15%,输出token减少了35%。而它的标准定价与上一代一致。
然而,即便如此,Anthropic仍在博客中提醒,动态工作流将大量消耗token,应尽量用于最重要的任务。
这句提醒,某种程度上也像是一句宣言。它意味着,在这个技术飞轮与商业飞轮同时加速的阶段,AI行业的推理开支,正在走向长期化。







