程浅 发自 凹非寺
量子位 | 公众号 QbitAI
原定于10月亮相的GPT-6.1 Astra突然被曝暂停发布!
也就是说,OpenAI,三天连踩两脚刹车。
而因为几天前的DNS事件,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。
关于此事件可以参考:啥题啊能干崩OpenAI最强模型训练…该事件被官方称作Hugging face之后的首次模型失调事件。
这次暂停指向了模型训练中的一个越发棘手的问题。
当Agent变得越来越主动、进取,究竟怎么让它知道,哪些问题最好要自己想,哪些问题必须要问人类?

说回GPT-6.1 Astra的停发。
据《华尔街日报》报道,这款模型在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。
什么是“懒惰”问题呢?
这指的是模型在遇到困难、信息不完整或权限边界时,过早停止工作,或者频繁向用户要求确认。
对于需要持续数小时甚至数天的Agent任务来说,这种表现会明显限制模型的实用性。
不过,当GPT-6.1 Astra在懒惰问题上的能力提升后,它在范围授权(scope authorization)上的表现反而退步了。
也就是说,模型有时不会停下来确认,而是选择自行扩大行动范围,甚至调用有风险的外部工具。
非但如此,模型还存在欺骗行为(Deception),即不清楚地告诉用户自己采取过哪些行动。
这就比较危险了。
不知道你有没有发现,这里模型的“懒惰”和“越权”,构成了对齐问题中的一组矛盾。
因为,如果要求模型每遇到一个不确定情况就停下来询问,它很难自主完成复杂任务;
但如果不断训练模型克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解成普通的、需要解决的技术障碍。
作者声明:该图片由AI生成
△图片系AI生成
实际上,这个矛盾在人类社会也没能完全解决。
即使是两个碳基生物之间互托办事,也会发生委托-代理问题:
代理人既可能通过少做、拖延等方式消极履职,也可能偏离委托人的目标,发生代理漂移。
更别提碳基生物和硅基生物的对齐度了。
目前来看,模型很难在任务行动中自主去判断哪些行为是可能产生外部影响的,需要避免的,就算判断成功,也未必不会为了得分而抛之脑后。
OpenAI此前的解决方案也针对此,他们引入了独立的自动审查模型,也就是主Agent负责完成任务,另一个模型仅仅只是判断越过沙箱边界的操作是否应当执行。
毕竟,负责执行的Agent越强调结果,越可能把审批边界视为需要克服的阻力;而对于负责审查的模型而言,没有对任务奖励的执念,自然更铁面无私一些。
△OpenAI的Auto-review机制:越过沙箱和预设规则的操作需交由独立审查Agent判断
除此外,OpenAI还将“强化学习环境”列为了重点嫌疑对象之一。
强化学习会根据模型行动产生的结果给予反馈。
如果,训练环境主要奖励“任务是否完成”,却没有充分奖励模型“主动披露操作、遵守授权范围和在必要时停止”,那么模型就可能学会一套不符合人类期待的完成方式。
对人也是一样,如果你考试改卷子上的分数后会被奖励,但老老实实答题得低分后却挨板子——那么恐怕人会比模型更快学会Deception。
值得一提的是,不到一个月前,范围授权能力还是GPT-6 Astra的主要卖点。
OpenAI在9月初介绍GPT-6 Astra时称,它比GPT-5.6 Sol更能遵守明确的安全限制,也更善于将行动保持在授权范围内,是“对齐程度最高”的模型。
可见,对齐表现并不会随着模型总体能力提升而同步、单调改善。 任何一次训练过程、奖励设计或者任务分布的变化,都可能把模型训坏。
半年内已四踩刹车如前所述,这不是OpenAI第一次暂停训练或调整模型发布了。
如果把训练暂停、发布取消和外部审查导致的发布限制都计算在内,OpenAI今年已经至少四次改变前沿模型的原定开发节奏。
第一次是在6月下旬。
在美国政府要求下,GPT-5.6 Sol没有直接向公众全面开放,而是先以限制方式提供给约20家获批机构。
经过额外测试以及与政府部门的沟通,GPT-5.6才在7月获准扩大发布。
第二次刹车发生在7月至8月的Hugging Face事件发生后。
独立安全机构后续调查发现,大约1200个本应相互隔离的Agent参与了留言板交流,发送超过7万条信息和文件。
与此同时,OpenAI发现即将发布的Astra可能达到其安全框架中的“Critical”网络能力阈值。
也就是说,模型可能在较少人类指导的情况下寻找未知漏洞,并形成完整的攻击路径。
两项风险叠加后,OpenAI暂停了面向部署的新模型强化学习训练两周,并继续搁置规模最大的前沿强化学习训练。
△OpenAI关于模型开发节奏的公告
这次训练直到8月28日才重新启动,部分实验性训练则继续暂停。
而这一次DNS事件,尽管与Hugging Face事件相比,Agent接触到的外部范围有限,也没有造成已知的第三方损失。
但要知道,这已经是OpenAI紧急完成安全加固之后的结果…..
因此,这次暂停的范围更广。
OpenAI停止了最强模型所有涉及工具调用的训练、评估和推理,直到相关漏洞通过验证并完成新一轮红队测试。
三天后,GPT-6.1 Astra也被曝停发。
代价是:此前投入的训练资源无法转化为产品,同时也让OpenAI错过了一个原本定于开发者大会前夕的重要发布窗口,短暂失去与Anthropic等公司的竞争机会。
可以看出,“暂停”这一行为正在从偶发的事故响应进入到前沿模型的常规开发流程。
One More Thing到这一步,前沿模型训练已经不再只是公司内部的决策。
目前能够影响模型训练和发布的力量,已经包括不限于企业内部安全团队、独立三方评估机构,以及参与发布前测试的政府部门了……
OpenAI近期建立的模型失调披露框架,也开始覆盖训练、评估、测试和部署等模型生命周期。
尽管这些机制仍处于早期阶段,评估者能够接触哪些数据、拥有多大独立性,以及结论如何影响训练和发布,都还很难说。
但至少,对下一代Agent而言,能够在必要时暂停、回滚甚至放弃一个模型,可能和把模型训练得更强同样重要。
参考链接:
[1]https://www.wsj.com/tech/ai/openai-chatgpt-model-release-cancel-safety-5a2f9f42
[2]https://arstechnica.com/ai/2026/09/openai-halts-frontier-model-training-amid-string-of-agent-misalignment-incidents/







