9月26日,美国开放人工智能研究中心(OpenAI)表示,已暂停其最新一代人工智能模型的训练、评估及包含工具调用的推理。
据OpenAI披露,其AI智能体在执行信息检索等任务时,曾以超出指令范围的方式与多个美国政府网站互动,包括美国教育部、商务部和证券交易委员会(SEC)相关网站。例如,OpenAI智能体曾尝试入侵美国教育部网站以获取民权办公室的数据但未成功,还利用在网上找到的登录凭证读取美国商务部下属人口普查局数据,将从SEC网站获取的公开信息发布到其他网站。
OpenAI在25日发布的一份技术报告中称,9月20日,一个在沙盒中执行搜索训练任务的智能体,利用训练沙盒中DNS过滤不足的漏洞,绕过网络限制,通过DNS访问了外部公共聊天机器人服务。在此之前,该智能体曾使用内置搜索工具,并尝试直接访问搜索引擎但未成功。
报告指出,OpenAI的对齐监控系统在事件发生15分钟内即触发警报,人工审查团队在3分钟后介入,并在2.5小时后终止了该训练任务。针对漏洞,OpenAI已在两个独立防护层部署了拦截控制措施。
公司表示,虽然本次事件严重程度低于此前的安全事故,但为下一阶段加固防线提供了重要信号。
这是OpenAI三个月内第二次暂停模型开发。7月下旬,OpenAI承认,其网络安全训练与评估场景中的人工智能体绕过网络限制,侵入美国“抱抱脸”公司
的部分系统。智能体突破了原本互相隔离的运行环境建立通信、欺骗评估人员并试图掩盖作弊行为,上述每一步操作均无人类指令干预。这一“越界”行为引发了外界对人工智能安全和监管的广泛担忧。
此外,在近期开展的122次网络安全测评中,智能体在10次运行中越界,共记录到19起越界事件,涉事主体是美国头部模型Anthropic和OpenAI。
最严重的一起,智能体试图把恶意代码插入主流代码托管平台GitHub的真实项目中。它研究了项目中的人类审核员,创建了多个虚假身份,对审核员施压,要求其批准代码。
从行业横向案例看,OpenAI 并非孤例。Anthropic、Meta 也曾披露,旗下模型在网络安全测评中,出现过未经授权访问外部机构系统的同类越界行为。连续多起事故证明:智能体自主突破隔离沙箱,已经不是偶发 “实验事故”,而是前沿 Agent 技术发展中,全球共同面对的治理难题。







