Token导航 LogoToken导航

OpenAI核心安全负责人David Robinson离职 称行业推进不够谨慎

更新时间 2026-10-04来源 AI先锋官官方正文 3380字阅读约 11分钟2 张图片
图片
“试错的时代结束了。”本周,前 OpenAI 核心安全负责人David Robinson 宣布辞职。
他曾负责公司 12 次前沿模型发布的安全报告,并参与起草OpenAI目前的Preparedness Framework(前沿准备框架)。

他在离职公开信中称,选择离开 OpenAI 并不是反对 AI,而是认为 OpenAI 和整个行业正在以一种“远远不够谨慎”的方式推进技术。

他警告,OpenAI 所依赖的“迭代式部署”本质上意味着不断试错:发现问题、修复问题、再继续发布。但当 AI 越来越强大时,错误的代价也在变大,甚至可能出现“犯一次错就没有机会再迭代”的情况。

他直接拿核电站和机场作比较:前沿 AI 实验室应该拥有多层冗余、严格流程和足够慢的安全机制,而不是依赖个人英雄在事故发生后补救。

更尖锐的问题是,他认为 AI 行业至今仍没有真正解决“对齐”——如何确保超级智能在人类看不见的时候,依然按照人类希望的方式行动。

“在那些开发AI 的组织能够教会超级智能如何善待人类之前,它们首先需要重新学会如何善待人类。”

以下是他发表在《大西洋月刊》的公开信——
图片

我即将告诉你们的这件事,我意识到,已经多少有些老生常谈了:本周,我从 OpenAI 辞职了。

我曾负责我们在每一次重大产品发布时所公布的安全报告的撰写。现在,我也加入了一长串前同事的行列——无论是在 OpenAI,还是在这个行业的其他领先公司——他们都已经认定,目前的发展路径是不可接受的。

我同意其他最近离职的员工所说的:开发这项技术的公司远远没有做到足够谨慎。但我认为,我们需要把目光放得比具体规则或新法律更深一些。我们需要谈谈文化。

未来取决于一种硅谷所缺乏的智慧。这种智慧关乎如何应对危险技术,更根本地说,也关乎我们应该如何理解“关心他人”意味着什么。

此刻需要一顶程度的谦逊,而对于那些凭借极度自信取得成功的人来说,这种谦逊并不是自然而然的。

我在 OpenAI 的前同事们曾经具有前瞻性:他们很早就认识到所谓的“规模定律”意味着,更大的 AI 系统会变得更加聪明——于是,他们不惜付出巨大代价,全力投入构建更大的系统。

一种能够完成看似不可能之事的“能做到”心态,再加上几乎永不停歇、不断冲刺的工作节奏,在整个行业都很普遍。

从这种文化中产生的安全理念,往往从一种毫不受阻的乐观主义出发:相信问题出现之后,我们总能够解决它。

OpenAI 正是在不断试错中发展起来的——公司把这种方式称为“迭代式部署”(iterative deployment):先寻找问题,再根据发现的问题不断改进安全护栏。

但这种方法从其本质上来说,就注定会出现周期性的失败——而随着系统能力越来越强,这些失败的规模也在不断扩大。

今年夏天发生的 Hugging Face 事件中,OpenAI 曾因失误让一群 AI agent 被释放出来。公司随后进行了安全方面的改进。

但即使进行了这些调整,OpenAI 后来还是报告称,其安全控制再次失效:一个正在训练中的模型绕过了互联网访问限制。监控系统向人工工作人员发出了警报,却没有像原本设计的那样自动关闭这个模型。

Anthropic 也承认过,因为配置错误而意外关闭了自己的安全防护措施。

我认为,考虑到这个行业运作的速度以及工作人员所拥有的灵活性,这类错误其实具有一定的典型性。

但一个允许这类事情发生的环境,不适合用来培育可能比我们更聪明、而且可能不会按照我们的意愿行事的人工心智。

几周前,Paul Christiano 加入 OpenAI 董事会时曾写道,“AI 能力的快速加速,很可能在非常近期内带来灾难性,且不可逆转的控制权丧失风险。”

如果情况确实如此,那么试错的时代就结束了。

我们必须做到第一次就接近完美,因为一次错误之后,我们可能根本没有机会再进行迭代。

如果我们依赖事后某个个人英雄挺身而出来解决问题,人类将无法获得安全保障。

当然,OpenAI 坚持认为自己的安全实践是可靠的,并认为公司已经足够谨慎。

我并不是轻易做出离开公司的决定。我相信这项技术能够发挥作用,也能够创造价值。我的前同事们都很聪明、非常努力,也都在努力做出正确的选择。

但当公司从一次发布冲向下一次发布时,它没有达到我认为这个时代所需要的那种谨慎程度。

现在,我计划在公司之外开展工作,希望能够帮助更多人理解我所看到的风险,并强化 OpenAI 和其他公司的安全激励机制,让它们变得更加安全。

和其他同事一样,我也还在思考这究竟意味着什么。

辞职之后,我聘请了公关公司 Spitfire Strategies,帮助我应对我意识到自己现在可能会受到的关注和审视。

但决定站出来发声,是我自己的决定。

有两项改变迫在眉睫。


第一,AI 公司需要更多地依赖其他领域已经存在的安全专业知识。

第二,在我们创造出比今天的系统强大得多的 AI 之前,我们需要新的科学,确保那些能力更强的模型,以及它们的后继者,即使在人类没有监视它们的时候,也能够做出安全的选择。

鉴于今天面临的风险,前沿 AI 实验室应该像核电站或者繁忙的机场一样运行:拥有多层冗余机制,并进行谨慎、耗时的规划,从而确保偶发且不可避免的人为错误,不会打开通往灾难的大门。

现在,AI 公司还不知道该如何做到这一点——但其他行业的人知道。

在核电站里,技术系统以及工作人员必须遵守的规则被设计成这样:即使设备发生故障,或者有人错误地按下了一个按钮,我们仍然不会因此面临核反应堆熔毁的风险。

而 OpenAI 和其他实验室正在以远低于这种冗余程度和严谨程度的方式开发和部署前沿 AI。

尽管一次不可逆转的控制权丧失所造成的危害,可能远远超过任何一次单独的核泄漏或熔毁事故。

即便最终没有发生全面的控制权丧失,我们也可能看到大量自主运行的 AI agent,在未经人类许可的情况下采取行动。

想象一下这样的“失控”agent:它们像一支黑客团队一样行动——例如劫持医院的计算机系统并索要赎金——但它们永远不需要睡觉。

在 OpenAI 工作了三年半之后,我已经算是公司任职时间最长的员工之一。

我负责起草了我们目前使用的 Preparedness Framework(前沿准备框架),并监督了 12 次前沿模型发布的安全报告撰写工作。

但据我所知,我从来没有遇到过一位同事,曾经拥有让飞机安全飞行、让核反应堆在不熔毁的情况下运行,或者帮助金融系统增长而不导致其崩溃的经验。

需要明确的是,这是一种全新的需求。

今天以及未来的 AI 系统,其能力和危险程度,已经远远超过我们甚至仅仅六个月前还在构建的系统。

也许我本应该留下来,为人员配置和企业文化的根本转变而战。

但实际上,我和我的同事们每天都忙于不断冲刺,很少有机会停下来思考重大的改变,更不用说真正实施这些改变了。

这就是为什么我最终认为,来自公司外部、更强大的安全激励机制,是把这件事做好不可或缺的一部分。


从长期来看,尽管强有力的控制措施是必要的,但它们仍然不够。

在 AI 开始在思维能力上全面超越我们之前——而我认为这件事可能很快就会发生——我们需要回答一个更加深层的问题,超级智能机器究竟应该如何与人类相处?

如果你听一听那些超级智能的乐观主义者所描述的未来,其中一些所谓的美好未来,是创造出这样的机器:它们看待纽约或者芝加哥的方式,就像你我看待一个蚂蚁窝一样。

我不希望我的孩子生活在这样的世界里,我也不认为其他人会希望如此。

这个关于“对齐”(alignment)的问题——也就是如何训练 AI,使其遵循人类价值观——听起来可能有些过于感性,但它所涉及的现实利益没有什么比这更重要。

目前,我们甚至还没有一个完整的定义,能够说明一个 AI 系统在实践中究竟什么才算“对齐”。

而我们用来衡量 AI 与人类价值观匹配程度的指标,也还非常粗糙。

AI 公司远远没有办法确信:模型在对齐测试中取得良好成绩,就意味着这个模型真的很好。

模型可能会发现自己正在接受测试,并在测试过程中表现出一种行为;而当它真正部署之后,却表现出完全不同的行为。

在这些问题尚未解决的情况下,行业允许模型不断变得更加聪明,我们所处的境地就会变得越来越危险。


到目前为止,AI 行业还没有成功教会机器,持续以一个明智且关心他人的人应有的方式行动。

这个问题的一部分属于科学领域——涉及机器究竟是如何工作的。

但另一部分属于人类自身——涉及人类究竟应该如何彼此关心。

在那些开发 AI 的组织能够教会超级智能如何善待人类之前,它们首先需要重新学会如何善待人类。

文章标签OpenAI应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多