Token导航 LogoToken导航TokenDH.com

Opus 4.8 不秀肌肉秀“诚实”:Claude反超OpenAI就开始挤牙膏?

更新时间 2026-05-31来源 前哨王煜全正文 2294字阅读约 8分钟5 张图片

5 月 28 日,Anthropic 发布了 Claude Opus 4.8,同一时段它也完成650万美元融资,估值突破9650万美元,正式反超 OpenAI。

不过单看评测数据,这次拿出来的Opus 4.8 像个平平无奇的小版本升级:价格没动,各项基准都涨了一些,但幅度不大,官方自己都说这只是“温和但确实存在”的进步。

不过我们发现一件事很值得关注,Anthropic这次强调的AI能力:诚实

这个细节背后,藏着 2026 年中美 AI 竞赛一次很关键的转向。

图片
Claude Opus 4.8 官方测评数据
Opus 4.8 这次更新,值得说的有四点

“诚实”被当成了主打卖点。 官方说明表示,新模型在自我评估上更诚实:更愿意主动标出自己没把握的地方,少了对结果打包票的毛病,放过代码错误的概率也明显降低。

在对齐评估里,它欺骗和配合滥用的比率大幅下降,已经接近被严格管控的 Mythos 预览版。

图片
Opus 4.8 对齐评估中的非对齐行为减少

动态工作流(Dynamic Workflows)。 Claude Code 现在能在一次会话里先把任务规划好,再并行拉起几百个子智能体,结果校验完了才汇报,号称能从头到尾搞定跨数十万行代码的“代码库级”迁移。

努力度滑块(Effort Control)。 你可以自己决定让它“想多深”:调高更慎重,调低更快、也更省额度,全计划都能用。

更快更便宜的 Fast 模式。 比上一代便宜约三倍,速度快约 2.5 倍。

把这几样放一块看,指向其实很清楚,一切都朝向Agent的执行能力上。

降价、提速、可控、肯说“我不确定”、能并行干重活,要的就是让更多人敢把工作交给它。

为什么“诚实”值得这么大书特书?

因为靠跑分定胜负这条路,正在快速失灵;而与此同时,比拼执行能力的Agent范式,正走在跨越裂谷的路上。

先说说 benchmark 为什么不够用了。

斯坦福 HAI 今年 4 月那份《2026 AI Index》给了行业一个有点警醒的判断:模型的能力,正在跑赢用来衡量它的那把尺子。

有个专门设计来为难 AI、对人类专家更有利的高难考试,叫 Humanity’s Last Exam,前沿模型一年之内就把分数拉高了 30 个百分点;不少本以为能难住 AI 好几年的题目,几个月就被刷穿了。

再看那些老牌榜单,MMLU、GSM8K、HumanEval 普遍都在 90% 以上,GSM8K 甚至冲到了 99%。当大家都能考 95 分,这张卷子自然就分不出高下。

中美顶尖模型只差 2.7%(两年前还差着 30% 以上),某种程度上正是“卷子出得太简单”的结果。

更麻烦的是,评测和现实之间那道沟,并没有被填上。

《2026 国际 AI 安全报告》专门点了这个“evaluation gap”:实验室里的高分,常常高估了模型在真实任务里到底有多好用。

一个能拿奥数金牌的 AI,读对一个模拟时钟的概率却只有 50.6%。

图片
模拟时钟读取准确率对比图

说白了,AI的能力没那么均匀,有的地方强得惊人,有的地方又弱得意外。越想把它塞进真实的工作流,可信赖度就越成了卡脖子的那一环。

大家关心的问题,已经从“AI聪不聪明”,变成了“Agent做得多好、代价多大、又是为了谁”。

这正是 Opus 4.8 押注“诚实”的用意所在。

真正的胜负手:Agent 能不能干活

从“模型有多聪明”,挪到“这个智能体能不能让人放心地用起来”。

这里有个挺有名的老概念,叫“跨越裂谷(Crossing the Chasm)”,是学者杰弗里·摩尔提出来的:

一项新技术想真正普及,得一关一关过,先是图新鲜的极客发烧友,再是讲实用的早期主流人群,最后才轮到普罗大众。

难就难在这中间。发烧友愿意为了“看起来很炫的技术”忍受一堆毛病,主流用户认的却是省心、可靠、拿来就能用。

同一个东西,两拨人的要求差着十万八千里,中间于是裂开一道“死亡之谷”。

图片
跨越裂谷理论

最早的电动车、VR/AR...不少技术就栽在这儿:在极客圈里风光无两,却始终迈不过主流那道门槛

2026 年,进化到 Agent 阶段的 AI,正卡在谷口。前哨科技特训营里我们分享过 agent 渗透率的数据,结论很直接:现在还非常早期。

年初国内那波 OpenClaw 全民装机、“养龙虾”的热闹就是个好例子。极客圈带着一大批普通用户一起上头,可这股热乎劲过去之后,现在还有多少人真在天天用呢?

Agent的范式转变确实已经开始,但它真要渗透到生活的角角落落,还得有段时间。Opus 4.8 这次更新,某种意义上就是在为这一步继续铺路。

不要等Agent大军来了才行动

说到底,模型还会一代一代变强,谁领先个半年,其实没那么要紧。

这有点像当年的搜索大战。

各家天天比“我的检索精度更高”,可对普通用户来说,真正拉开差距的从来不是哪家引擎更准,是你会不会用搜索,会不会搭关键词,会不会交叉验证,会不会把搜索揉进自己的工作流。

Agent 时代也是一个道理。与其干等那个“最强模型”,不如现在就把手头的工具用起来、用顺手。把管理 Agent 这些“数字员工”的门道摸透,等它越来越强的时候,你也能跟着一起水涨船高。

前哨 AI 小课,讲的就是这件事:从怎么选模型到怎么搭智能体,带你把 AI 真正变成能托付的生产力,而不只是一条看个热闹的跑分新闻。

这周日的这一讲,就手把手带你上手眼下最能“干活”的编程智能体之一:Codex。

图片
OpenAI Codex app 界面截图
  • ClaudeCode vs Codex:两者到底差在哪、该怎么选
  • 安装与配置 Codex:跟着走一遍,零基础也能跑通
  • 三个实操案例:批量处理文件、销售数据分析与可视化、从零开发一个网站

两年前,我们问的是谁的模型更强。今天更该问的是:当你要把一整天的活儿都交给一个 AI,你敢交给谁?

要回答这个问题,第一步,是先把 AI 用起来。

文章标签ClaudeOpenAIAnthropic智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多