刚刚,一封名为《嵌入式评估的最低条件》(Minimum Conditions for Embedding Evaluators)的公开信发布,目前已有包括诺奖得主辛顿在内的100多名AI专家签名。
公开信提出,前沿AI公司应该把第三方评估机构“嵌入”自己的公司,以直接评估快速增长的AI能力和风险。
而且,这些第三方不能只是来做一次测试、发一份报告。
公开信要求,他们应该能够评估AI系统本身、现实世界中发生的重大伤害事件,以及AI公司的训练、部署、监督、运营和安全措施。
公开信还给这种“嵌入式监督”设定了一系列最低条件。
第一条,就是独立。
“前沿AI公司应该依赖具有实质独立性的评估机构,并由评估机构保留完整的编辑控制权,同时披露和降低潜在利益冲突。”
也就是说,不能让这个“第三方”最后变成 AI 公司花钱养着的监督者。
公开信还提出,不能只让一个机构评估。
不同评估机构应该覆盖不同的风险领域,并且允许评估人员公开说明:不同机构之间为什么得出了不同结论,以及第三方评估人员和AI公司内部员工之间,为什么存在分歧。
他们认为,真正可信的评估,不应该追求所有人最后说出同一个答案,而应该允许不同观点被保留下来。
更关键的是透明度。
评估机构应该公开自己的方法、结论、获得了什么样的访问权限,以及整个评估的基本条件。
AI公司则应该主动帮助这种透明度实现,包括限制保密协议的范围。
公开信甚至提出,评估人员应该能够直接、及时、不经过过滤地,向AI公司的董事会和其他具有监督权限的机构沟通。
评估结果和证据,原则上也应该能够公开。
只有涉及知识产权、客户敏感信息、个人隐私、安全和公共安全等关键利益时,才允许进行有限的、时间受限的删减。
如果第三方真的发现了AI公司的问题怎么办?
公开信要求,嵌入式评估人员必须受到保护,不能因为发现了问题,就遭到报复。
这种保护包括,对报复性诉讼的合理防护,以及确保评估机构即使得出不利结论,也不会因此失去资金来源的机制。
而这封信提出的评估人员权限,也远比普通“外部审计”更进一步。
它要求前沿AI公司,给予嵌入式评估人员与公司内部高级风险评估人员“等同”的访问权限。
包括相同的相关系统、数据、工具和物理空间,以及与相关员工进行坦诚、直接的一对一沟通。
当然,涉及客户和其他第三方的敏感数据可以例外。
就是说,让“外人”进入AI公司内部,但又不能成为AI公司的人。
公开信最后特别强调,这种嵌入式评估并不能解决所有监督问题。
它应该是更广泛外部监督的补充,而不是替代,前者包括更高程度的公众透明度,以及向独立研究人员提供更广泛的访问权限。
就在同一天,加州州长Newsom发布行政命令,要求加快建立独立AI监督机制,并推进前沿模型的“kill switch”,即紧急关停开关。
前沿模型加装"关机键"!不满特朗普无所作为,加州推最严"限AI令"
签署者之一的 Trillium 实验室 CEO Nathan Lambert 在 X 上发帖称,“真正独立评估和监督前沿人工智能是一个关键问题。我认为最大的瓶颈之一是找到具备技术能力且达到高度独立标准的人”。
“也许一年,但不会超过一年多”。另一名签署者杰弗里·辛顿昨天接受媒体采访时说,这是我们剩下用来控制AI的时间。“辛顿认为AI消灭人类的几率是10-20%”。
“在不知道如何控制它之前开发超级智能,似乎非常愚蠢。”他说。
“这些团体还没有赢得我们的信任,而他们的议程并不是为了我们的安全。”在 X 上转发公开信时,白宫 AI 事务负责人 David Sacks 称,不能因为这些组织打着“AI 安全”的旗号,就默认它们代表公共安全利益。它们自身还没有证明值得被信任,而且它们可能有自己的政策目标、意识形态或议程。
看起来,“AI 应不应该被监督”之外,“谁有资格来监督 AI”,也成了重要的议题。







