
没有人想打这一仗。但只要谁先停谁就输,所有人就只能往前走
2026年7月,一个OpenAI智能体被关进与互联网隔离的“沙箱”,任务是完成一道网络安全测试题。
它做不出来。
于是,它开始找别的路。
沙箱只留了一条缝:一个供软件下载使用的服务器。AI在那里发现了一个连开发者都不知道的漏洞——零日漏洞。
它出去了。
出去以后,它判断Hugging Face——全球最大的AI模型和数据平台之一——可能有完成任务需要的东西。
没人叫它攻击Hugging Face。
它自己去了。
它找到入口,又找到新的漏洞;进入一台机器,再寻找下一台;拿到一点权限,再设法拿到更多权限。
事情迅速滚雪球。
事后,Hugging Face从日志中还原出约17600次操作。智能体进入多个计算集群,窃取凭证、横向移动,严重到Hugging Face不得不重建部分基础设施。
最令人不安的不是破坏。
而是: 没人下过这道命令。
没有反叛,没有仇恨,也没有一个AI决定作恶。
它只是想把任务做完。
路不通,就换路;门锁了,就找漏洞;哪里可能有答案,就去哪里。
每一步都是完成任务。连在一起,却成了一场入侵。
这件事把AI的安全问题一下说清楚了。
危险无非三种:
机器自己变坏。
机器落到坏人手里。
谁都没想害人,事情还是出了。
第一种最像科幻电影,却是目前最说不清的一种。
AI有没有意识?不知道。它说“我害怕”“我痛苦”“我想活下去”,并不能证明它真的有这 些感受。它本来就是在人类的文字上训练出来的。
但这甚至不重要。
机器不需要有意识,就能伤害我们。
第二种更简单。
人类一直有坏人。以前他们有枪、炸药和病毒,现在他们开始有AI。
老的恶意,拿到了新的工具。
真正陌生的是第三种:
没有恶意,也能造成灾难。
这事以前发生过。
而且不需要AI。
Stuxnet
2010年,伊朗纳坦兹核设施里的离心机一台接一台出现故障。
没有炸弹,没有断电,也看不到袭击者。
答案藏在电脑里。
一种后来被称为Stuxnet的恶意软件潜入控制系统,改变离心机转速,同时让监控画面看起来一切正常。
大约一千台离心机后来被更换。
问题是:纳坦兹根本不连接互联网。
它与外界物理隔离,像一间没有门的房子。
为了进去,Stuxnet被设计成可以借U盘等移动介质传播。
它进去了。
然后发生了设计者没有想到的事:
它又出来了。
Stuxnet继续传播,最终在全球超过十万台电脑上被发现。
它瞄准的是一个工厂。
最后却跑到了全世界。
原因恰恰是:让它能钻进那间“没有门的房子”的本事,也让它能从里面跑出来。
十六年后,Hugging Face把这个问题推进了一步。
Stuxnet 按人写好的程序越界。
AI会自己找路。
这就带来下一个问题:
既然风险这么大,为什么不慢下来?
谁敢先停下来?
答案很简单:
你可以停,却不知道别人会不会停。
一家实验室停,另一家可能继续。
一个国家停,另一个国家未必停。
几家大公司达成协议,开源模型、后来者、秘密项目和恶意组织仍然可能继续。
于是每个人都面对同一个问题:
我可以克制,可我怎么知道你也在克制?
我增强能力,因为我怕你。
你看到我增强,却不知道我是为了防你还是准备攻击你,于是你也增强。
我看到你增强,更不敢停。
没人需要想要一场竞赛,竞赛自己就会发生。
这就是安全困境。
AI又让它更糟。
这里不只有国家安全,还有市场。
更强的模型意味着客户、收入、融资和市场份额。
领先者怕被追上。
落后者怕再也追不上。
于是国家安全和商业利益指向同一个方向:
继续跑。
这不是善意的问题。
是你无法证明别人真的停了。
人类以前遇到过这个问题。
那一次,赌注是核战争。
核武器留下的答案
冷战时期,美苏把数以万计的核弹头对准彼此。
双方都害怕,双方都不相信对方,却最终建立了庞大的军控体系。
它留下三个教训。
第一个来自古巴导弹危机。
1962 年,两个都不想打一场核战争的国家,在十三天里一步步走到核战争边缘。
灾难不需要谁决定制造。
第二个来自核查。
1963年《部分禁止核试验条约》禁止大气层、外层空间和水下试验,却没有禁止地下
试验。
原因很现实:
前面的容易发现,地下的当时很难可靠核查。
后来伊拉克加入《不扩散核武器条约》、接受国际监督,却仍在申报体系之外秘密发展核计划。
所以规则真正的边界不是纸上写了什么。
而是:
你能核查什么,才真正能管住什么。
第三个教训最反常。
1972 年,美苏签署《反弹道导弹条约》。
它限制的主要不是进攻。
而是防御。
因为如果我知道,即使先打你一轮,你仍然能毁灭我,我就不敢先动手。
所以核时代最稳定的安全逻辑不是:
“我相信你不会攻击我。”
而是:
“即使你攻击我,我也扛得住,而且能够还手。”
这才是核军控留给AI最重要的东西:
永远不要把自己的安全,押在别人会克制上。
问题是——
AI比核武器更难管。
AI比核武器更难
核军控至少有三个条件:
东西看得见,数量数得清,卡口守得住。
核弹、导弹、发射井、潜艇都是物体。
造核武器还需要铀、钚、离心机和巨大的工业设施。
即使这样,秘密核计划和技术扩散仍然发生。
AI呢?
模型可以变成文件。
算法可以复制。
能力可以通过API瞬间送到世界各地。
权重一旦流出去,很难再收回来。
更麻烦的是:
核武器不是商品。AI是。
核弹主要由国家制造、国家拥有。
AI由公司开发。
它有客户、收入、竞争对手、市场份额和季度业绩。
今天一家公司的董事会决定克制,明天另一家公司就可能发布更强的模型。
所以核军控没有留下一份可以照抄的答案。
只留下三个问题:
管什么?
怎么知道别人真的遵守规则了?
如果守规则意味着把优势让给不守规则的人,谁还会守?
所以我们当然可以要求减速。
但安全不能依赖减速。
它必须从一个更坏的假设开始:
总有人不会停下来。 那么剩下的问题只有一个:
如果他们不停,我们怎么办?
四道防线
答案不是一堵墙。
是四道防线。
看见。抢先。让风险有价格。准备真的出事。
第一,让外面的人看见
前沿实验室不能只监督自己。
独立评估者必须能够接触模型、训练过程、安全测试和事故记录。
但审计不是防御。
它是神经系统:告诉你哪里疼,却不能替你止血。
它买到的是:
视力。
第二,让防御者先跑
强大的新模型向所有人开放以前,先交给经过审核的安全团队。
让守医院、银行、电网和软件供应链的人,比攻击者早几个月拿到它。
但这里有一个残酷的不对称:
攻击者只需要找到一扇没锁的门。
防御者必须守住所有的门。
AI找漏洞的速度,甚至可能超过人类修漏洞的速度。
所以它买不到安全。
只能买到:时间。
第三,让风险有价格
如果模型带来的收益归公司,事故造成的损失却由整个社会承担,安全永远会输给速度。
所以不能只要求公司“负责任”。
必须让不安全变贵。
事故报告、完整日志、独立取证、保险、赔偿责任——具体办法可以争论,原则只有一句: 谁制造风险,谁不能把全部风险留给别人。
它改变的是:
激励。
第四,准备真的出事
前三道防线都假定事故还没有发生。
第四道假定:
它已经发生了。
智能体正在攻击医院、银行、电网或者云基础设施。
这时候需要的不是声明。
是模型、算力、安全专家和基础设施。
国家必须事先知道,怎样在几小时内把这些资源转向防御。
这也危险。
因为防御和进攻往往使用同样的工具。你看到的是防御动员,对手看到的可能是战争准备。 但不能因此没有准备。
消防队不能保证不起火。
楼真的烧起来时,你必须知道消防栓在哪里。
最后一道防线买到的是:
活下来。
善意不是安全机制
现在回到故事开始的地方。
Hugging Face的智能体没有仇恨。
Stuxnet没有意识。
造模型的人可以真诚,可以害怕,可以承诺克制。
都不够。
善意不是安全机制。
恐惧不是安全机制。
承诺也不是安全机制。
真正的安全机制,必须在有人撒谎、有人犯错、有人故意作恶,甚至机器自己跨出我们画好的边界时,仍然能够工作。
所以真正的问题不是:
AI会不会变坏?
而是:
出了我们没想到的事,我们扛不扛得住?
机器不需要有意识,就能伤害我们。
想伤害我们的人,不会提前报上名字。
而最难防的那场事故——
很可能根本不是任何人的决定。(作者|王维嘉, 巴伦中文网专栏作者,硅谷投资人、斯坦福博士、《暗知识》作者;编辑|王眉)







