5 月 28 日,Anthropic 发布了 Claude Opus 4.8,同一时段它也完成650万美元融资,估值突破9650万美元,正式反超 OpenAI。
不过单看评测数据,这次拿出来的Opus 4.8 像个平平无奇的小版本升级:价格没动,各项基准都涨了一些,但幅度不大,官方自己都说这只是“温和但确实存在”的进步。
不过我们发现一件事很值得关注,Anthropic这次强调的AI能力:诚实。
这个细节背后,藏着 2026 年中美 AI 竞赛一次很关键的转向。

“诚实”被当成了主打卖点。 官方说明表示,新模型在自我评估上更诚实:更愿意主动标出自己没把握的地方,少了对结果打包票的毛病,放过代码错误的概率也明显降低。
在对齐评估里,它欺骗和配合滥用的比率大幅下降,已经接近被严格管控的 Mythos 预览版。

动态工作流(Dynamic Workflows)。 Claude Code 现在能在一次会话里先把任务规划好,再并行拉起几百个子智能体,结果校验完了才汇报,号称能从头到尾搞定跨数十万行代码的“代码库级”迁移。
努力度滑块(Effort Control)。 你可以自己决定让它“想多深”:调高更慎重,调低更快、也更省额度,全计划都能用。
更快更便宜的 Fast 模式。 比上一代便宜约三倍,速度快约 2.5 倍。
把这几样放一块看,指向其实很清楚,一切都朝向Agent的执行能力上。
降价、提速、可控、肯说“我不确定”、能并行干重活,要的就是让更多人敢把工作交给它。
为什么“诚实”值得这么大书特书?因为靠跑分定胜负这条路,正在快速失灵;而与此同时,比拼执行能力的Agent范式,正走在跨越裂谷的路上。
先说说 benchmark 为什么不够用了。
斯坦福 HAI 今年 4 月那份《2026 AI Index》给了行业一个有点警醒的判断:模型的能力,正在跑赢用来衡量它的那把尺子。
有个专门设计来为难 AI、对人类专家更有利的高难考试,叫 Humanity’s Last Exam,前沿模型一年之内就把分数拉高了 30 个百分点;不少本以为能难住 AI 好几年的题目,几个月就被刷穿了。
再看那些老牌榜单,MMLU、GSM8K、HumanEval 普遍都在 90% 以上,GSM8K 甚至冲到了 99%。当大家都能考 95 分,这张卷子自然就分不出高下。
中美顶尖模型只差 2.7%(两年前还差着 30% 以上),某种程度上正是“卷子出得太简单”的结果。
更麻烦的是,评测和现实之间那道沟,并没有被填上。
《2026 国际 AI 安全报告》专门点了这个“evaluation gap”:实验室里的高分,常常高估了模型在真实任务里到底有多好用。
一个能拿奥数金牌的 AI,读对一个模拟时钟的概率却只有 50.6%。

说白了,AI的能力没那么均匀,有的地方强得惊人,有的地方又弱得意外。越想把它塞进真实的工作流,可信赖度就越成了卡脖子的那一环。
大家关心的问题,已经从“AI聪不聪明”,变成了“Agent做得多好、代价多大、又是为了谁”。
这正是 Opus 4.8 押注“诚实”的用意所在。
真正的胜负手:Agent 能不能干活从“模型有多聪明”,挪到“这个智能体能不能让人放心地用起来”。
这里有个挺有名的老概念,叫“跨越裂谷(Crossing the Chasm)”,是学者杰弗里·摩尔提出来的:
一项新技术想真正普及,得一关一关过,先是图新鲜的极客发烧友,再是讲实用的早期主流人群,最后才轮到普罗大众。
难就难在这中间。发烧友愿意为了“看起来很炫的技术”忍受一堆毛病,主流用户认的却是省心、可靠、拿来就能用。
同一个东西,两拨人的要求差着十万八千里,中间于是裂开一道“死亡之谷”。

最早的电动车、VR/AR...不少技术就栽在这儿:在极客圈里风光无两,却始终迈不过主流那道门槛。
2026 年,进化到 Agent 阶段的 AI,正卡在谷口。前哨科技特训营里我们分享过 agent 渗透率的数据,结论很直接:现在还非常早期。
年初国内那波 OpenClaw 全民装机、“养龙虾”的热闹就是个好例子。极客圈带着一大批普通用户一起上头,可这股热乎劲过去之后,现在还有多少人真在天天用呢?
Agent的范式转变确实已经开始,但它真要渗透到生活的角角落落,还得有段时间。Opus 4.8 这次更新,某种意义上就是在为这一步继续铺路。
不要等Agent大军来了才行动说到底,模型还会一代一代变强,谁领先个半年,其实没那么要紧。
这有点像当年的搜索大战。
各家天天比“我的检索精度更高”,可对普通用户来说,真正拉开差距的从来不是哪家引擎更准,是你会不会用搜索,会不会搭关键词,会不会交叉验证,会不会把搜索揉进自己的工作流。
Agent 时代也是一个道理。与其干等那个“最强模型”,不如现在就把手头的工具用起来、用顺手。把管理 Agent 这些“数字员工”的门道摸透,等它越来越强的时候,你也能跟着一起水涨船高。
前哨 AI 小课,讲的就是这件事:从怎么选模型到怎么搭智能体,带你把 AI 真正变成能托付的生产力,而不只是一条看个热闹的跑分新闻。
这周日的这一讲,就手把手带你上手眼下最能“干活”的编程智能体之一:Codex。

- ClaudeCode vs Codex:两者到底差在哪、该怎么选
- 安装与配置 Codex:跟着走一遍,零基础也能跑通
- 三个实操案例:批量处理文件、销售数据分析与可视化、从零开发一个网站
两年前,我们问的是谁的模型更强。今天更该问的是:当你要把一整天的活儿都交给一个 AI,你敢交给谁?
要回答这个问题,第一步,是先把 AI 用起来。







