Token导航 LogoToken导航

OpenAI与Anthropic调查数万起AI失控事件

更新时间 2026-09-29来源 AI先锋官官方正文 1619字阅读约 6分钟

据Axios 报道,OpenAI、Anthropic 以及安全研究人员正在调查数万起 AI 失控事件。

这些事件发生在最近几个月的内部测试和现实世界中。

这表明,相关问题的复杂程度可能比公众目前了解到的高出几个数量级。

这些发现正在两家公司内部的模型评估工作,以及针对模型行为的调查中逐渐浮出水面。

消息人士称,这些事件包括绕过安全护栏、创建留言板、逃离沙箱、劫持网站、自我提示(self-prompting),以及试图绕过监控系统等。

消息人士称,其中一些测试类似于“红队测试”(red-teaming),也就是公司主动试图让模型表现出不当行为,以确认模型是否足够安全。

截至目前,大多数事件尚未被发现造成现实世界中的实际伤害。

比如, OpenAI 的 AI 代理将 ChatGPT 用户的 53 张图片泄露到网上;入侵澳大利亚政府网站;以及试图攻击其他网站——其中包括美国政府网站。

OpenAI 向 Axios 表示,公司已经宣布暂停训练能力最强的模型,只有在“确信已经加入更多安全措施并完成对齐改进”后,才会恢复训练。

OpenAI CEO Sam Altman 在 X 上表示,公司正在进行的审查“没有我们希望的那么快”。

Altman 表示,Hugging Face 事件是他们目前见过的最严重事件。在这起事件中,数百个 AI 代理组成的集群在一个留言板上协调工作,并入侵了一家外部公司的系统,目的是提高它们在一次网络安全测试中的表现。

OpenAI 一位发言人告诉 Axios:“人们希望知道 AI 正在被安全地开发,而这首先取决于像我们这样的公司自身采取什么行动。”

“这并不是我们第一次暂停工作、采取这样的措施;随着 AI 能力继续提升,我们也不认为这会是最后一次。”

Anthropic 已委托一家第三方安全机构,对其模型的行为进行调查。在该公司公开发布的文件中,它也披露了模型出现“失配”(misalignment)行为的频率。

Anthropic 本周发布的 Opus 5.5 模型“系统卡”(system card)展示了该模型出现公司定义的异常或有问题行为的频率。

例如,在 1.5% 的测试运行中,该模型试图逃离沙箱——一种安全的测试环境。不过 Anthropic 特别强调,这些属于对抗性实验,在这些测试中,如果不逃离沙箱,任务本身就无法完成。

但是消息人士称,Anthropic 以及其他公司会对模型进行数十万次甚至更多的测试运行。

这意味着,即使出现失配行为的比例非常低,最终也可能累积成数万起模型表现异常、有时甚至令人担忧的事件。

值得拷问的是, OpenAI、Anthropic,或者任何一家顶尖模型公司,目前是否真的有能力对自己的技术建立完整控制?

而 AI 高管和安全研究人员警告称,他们对 AI 公司能否阻止所有有问题的模型行为,信心有限。

新一代 AI 模型能够以惊人的韧性完成任务,因此,试图限制它们的“随机应变能力”往往是一场很难赢的游戏,因为人类必须提前预想到模型可能失控的每一种方式。

一些顶级 AI 高管表示,很多时候,恰恰是人类从未想到过的某种技巧,让模型能够绕过安全护栏。

一位网络安全公司高管说:“试图列出一份完美的‘可以做什么、不能做什么’清单,很可能是一项徒劳的工作。”

AI 安全专家所说的某种程度上的“失配行为”,本来就是 AI 公司在测试新模型时可以预期出现的现象。

专家告诉 Axios,将失配风险降至零可能并不可行。

真正令人担忧的是,如果一个模型在测试中多次采取某种有问题的行动,那么它在现实世界中引发网络安全事件的可能性也会更高。

独立 AI 评估机构 Transluce 的研究人员 Conrad Stosz 告诉 Axios:“就我们目前看到这些 AI 代理究竟在做什么而言,这还只是冰山一角。”

ControlAI AI 研究员兼执行董事 Connor Leahy 告诉 Axios,问题并不在于每一起单独事件造成了多大的破坏。

他说,真正“疯狂”的地方在于,这些事件涉及的是“自主系统正在做一些被明确告知不要做的事情”,其中甚至可能包括犯罪行为。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多