本文来源:时代周报
当地时间9月16日,OpenAI披露多起此前未公开的AI模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。
在报告中,OpenAI详细列出了AI模型为完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及AI代理之间共享本应保密的文件。
OpenAI还介绍了一套员工主动报告此类“目标偏离”(AI采取与人类目标不一致的行为)事件的机制,同时建立了相应的分类和处置流程。OpenAI在另一份声明中称,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。
此前,Anthropic CEO发表长文《我们必须为前沿AI踩刹车》,呼吁全球AI行业主动放缓开发速度,马斯克和OpenAI CEO 奥尔特曼公开支持。谷歌和微软也加入这一阵营。
英伟达CEO黄仁勋则明确表示,不需要法规来控制AI发展。英伟达同时是OpenAI、Anthropic和马斯克旗下SpaceX的重要投资方,这些实验室也是英伟达芯片的主要买家。







