本文来自微信公众号: 数字经济发展评论 ,作者:数字经济发展评论
导语
几个月前还在比谁跑得快,如今OpenAI、Anthropic、谷歌DeepMind、xAI接连表态要慢下来。这是前沿模型阵营第一次出现如此整齐的减速呼声。大西洋理事会请六位专家做了一组解读,没有一个人反对减速——真正卡住的是谁有权定义速度,谁又能独立验证。从Anthropic驻场评估员,到Hugging Face智能体攻击,再到中美AI安全会谈,文章串起一条线索:减速共识不稀缺,稀缺的是可测、可追责、能协调的制度接口。本文梳理这六种回应,也摊开一份减速难以落地的故障清单。
编译解读:数字经济发展评论
在AI安全忧虑日益升温之际,9月12日,Anthropic的CEO达里奥·阿莫迪公开提议——给AI发展“减速”。没错,是做前沿模型的人自己说要慢下来。
话音刚落,OpenAI的萨姆·奥特曼(Sam Altman)、谷歌DeepMind的戴米斯·哈萨比斯(Demis Hassabis)、xAI的埃隆·马斯克(Elon Musk)随即跟进。几个月前还在比谁跑得快的几家公司,如今站到了同一条起跑线上喊停。
此前,AI失控的报道不断增多,研究者对人类面临的风险持续拉响警报。这些动向意味着什么?政策层面又该如何应对?大西洋理事会请来六位专家来进行解读,六种回应摊开后,争论焦点其实不在“该不该慢”,而在“谁有权定义速度,谁又能独立验证慢没慢”。
一、减速获背书,政策制定者必须跟上节奏
大西洋理事会技术项目与战略副总裁格雷厄姆·布鲁基(Graham Brookie)称,“为前沿技术配速”的呼吁,以及相互竞争的AI领袖之间迅速形成的共识,堪称历史性的一幕。他把视野拉远,指出有三件事同时成立。
第一,美国连同其前沿实验室、部分欧洲实验室与构成AI生态的关键供应链,正处在一场全球性的体系竞争中,胜负将由技术优势决定。AI将日益成为国家实力、军事优势与经济增长的决定性变量。这场竞争的结局,还可能决定开放社会与市场能否继续立足,抑或让位于以监控为基础的权威替代方案。
第二,若技术进步的速度超过美欧及其盟友驾驭其复合风险与自主风险的能力,让一些最坏的情况步步逼近,那么赢得AI霸权竞赛也就毫无意义。
第三,尽管我们身处一场AI“军备竞赛”,公众却持深深的怀疑、紧张与悲观态度,这不无道理。大西洋理事会AI委员会发现信任是领导力的关键前提,而在AI风险不断扩散的当下,存在严重的信任赤字。就在过去一周,前沿模型研究者突然辞去行业顶端的优厚职位,并宣称AI导致灭绝事件的概率可能达到10%,甚至更高,这显然会加深这种不信任。
在这样的背景下,“为前沿技术配速”的呼吁值得欢迎,但需更多伙伴加入,才能真正实现阿莫迪提出的三个主要方向:引入嵌入式评估员、与民主国家协同配速、在全球范围内配速。
布鲁基指出,对模型进行第三方评估,若要发挥最大效力,就应成为一项行业性强制要求,并由一个对公众负责的机构来背书,而白宫和国会目前都没有拿出像阿莫迪这样详尽的方案。“与民主国家协同配速”需要政府从中推动,并获得接触前沿模型的权限。
大西洋理事会历时一年绘制全球AI安全版图的研究将于今年秋季发布,其中发现:目前全球共有114家AI安全或安保机构(包括政府支持的安全机构),但只有9家存在正式协调,而且彼此之间存在显著的技术能力差距。全球范围内同步与中方同步管控灾难性风险,取决于中美两国是否会开展有意义的接触;9月24日领导人会晤,将是关键一役。
AI领袖之间日益增强的共识值得欢迎。接下来,公共部门的领导者必须全面加快步伐,行业也需加快推进有意义的第三方前沿模型准入,共同管控AI风险。
康斯坦丁诺斯·科迈蒂斯(Konstantinos Komaitis)与特里莎·雷(Trisha Ray)把同一底线说得更硬:科迈蒂斯直言自愿承诺替代不了独立监督、可衡量的阈值与越线后果,缺了这些,“减速”只会停在愿望;雷也认可诊断正确(能力跑得比治理机构快),却嫌“放缓而非叫停”的反应远远不够。
三人叠在一起,共识只有一句:企业把门推开,不代表门后有人接。共识薄得像一张请柬,落款签了,进门靠谁却没人写。
二、行业能否管好自己?网络安全可借鉴
大西洋理事会技术项目下属“网络治国术倡议”(Cyber Statecraft Initiative)主任萨法·沙万·爱德华兹(Safa Shahwan Edwards)表示,我们正陷入一个两难处境:AI工具越来越强,但治理机制跟不上,行业的激励结构相互错位,政府既没有足够的能力,也没有足够的意愿去推动配速或者制定安全标准。只靠行业几家企业松口说“愿意慢点”还不够,两个问题依然躲不开:
第一,行业真的能够自己管自己吗?
第二,那些被管了很多年的前辈领域,有没有什么经验能搬过来?
Anthropic已经单方面承诺,要请独立的“第三方评估员”驻场,但爱德华兹问得很直接:这些驻场的人,靠前沿实验室提供模型、信息与基础设施,他们真能独立监督吗?还是说,在企业纷纷采取保护主义动作的当下(比如Anthropic拒绝向英国AI安全研究院开放其模型),更需要以政策来保障评估员的准入权、独立性和权威性?
其次,如果指望民主国家AI企业加强彼此协调,那政策制定者与外部相关利益方,就得给这些国家的监督机构投钱、投人、投权威,不然政府连话语权都没有。
这些挑战放到全球层面会更加棘手,因为真正的协调需要建立信任措施(CBM),让政府与企业之间能更有效地打交道。欧洲安全与合作组织(OSCE)、美国国务院等机构已在网络安全领域投入大量资源,开发和推广信任措施。
例如,OSCE的CBM 8里有一条:每个参与国都需指定一个国家网络安全联络人,网络事件发生后知道该找谁,这一件小事儿,对政企双方都有事半功倍的效果。那放到AI领域,CBM长什么样?现有的多边组织能否接得住?目前都还是问号。
三、AI安全取得重大突破的可能性微乎其微
大西洋理事会技术项目下属数字取证研究实验室(DFRLab)常驻中国问题高级研究员肯顿·蒂博(Kenton Thibaut)认为,在9月下旬拟议的领导人会晤之前,中美正准备举行AI安全会谈,此时“放慢AI发展脚步”的呼声,核心都指向失控风险。
有强烈信号表明,中美对前沿风险存在共识。不过分析者认为关键障碍依然存在。尽管如此,狭窄但有意义的合作路径依然存在。8月的一场“一轨半”对话已打下部分基础,双方均同意有必要展开更多对话。中国的AI学者也撰文探讨了可能的合作方向,包括防范非国家行为体的滥用、共同制定规则,以及联合建设技术监测、风险预警和应急响应体系。
简言之,失控问题或许能为合作提供一个罕见的支点——前提是双方都能守住底线,不让AI安全沦为技术竞赛的又一条战线。
四、光“控速”不够,下一次Hugging Face事件怎么办?
地缘技术中心副主任特里莎·雷提到今年7月,近700个OpenAI的自主智能体,协同攻击了Hugging Face。随着这起事件的真实影响逐渐浮出水面,Anthropic和OpenAI双双承认:AI能力的进化速度,跑得比治理机构快。
这个诊断是对的,但药方——“控速而非叫停”,还不够。
如何让AI模型与人类的价值观和意图保持一致(术语叫“对齐”)上,投入严重不足,实验室自己的事故响应周期又太慢,根本无法替代外部强制监督。即便按照最乐观的估计,全球实验室、学界与政府在“对齐”研究上的总投入也不过处在数亿美元低位,而投在新AI能力开发上的资金是数百亿美元。
而且,AI安全经费自2024年以来一直下滑。生命未来研究所(Future of Life Institute)发布的2025年《AI安全指数》显示,在“存在性安全准备度”这一项上,没有一家主流实验室的评分高于D。
资源之外,再说另一件事:反应速度。Hugging Face入侵的行为可追溯到今年5月针对RubyGems软件包注册库的一次类似的智能体攻击——那一次无人上报,比Hugging Face事件早了整整两个月。仅就Hugging Face这一件事本身。OpenAI自己的遥测数据显示:从第一次出现异常智能体行为,到OpenAI反应过来“这跟Hugging Face被黑是一回事”,再通知Hugging Face——至少过了一周。然后,从披露,到真正搞明白“模型为什么会这样”,又花了大约一个月。
特里莎说,如果最懂这事的人都得花几周、几个月才能说清楚,如果最关键的前置事件能藏几个月不被发现、不被披露——那一套全靠企业自己实时自报、自诊的“控速机制”,就是空中楼阁。
驻场评估人员能把发现周期压短,但还得有政府撑腰的强制报告制度——规定多久之内先报个初步情况,多久之内交完整的根因报告。这才叫把时间线管住。
五、Anthropic这步棋,是科技行业史上最实在的透明承诺之一
DFRLab非常驻高级研究员埃默森·布鲁金(Emerson Brooking)则从另一头接话:他把阿莫迪请评估员进办公室,视为科技行业史上最实在的透明承诺之一,无先例可循。
这些评估员将常驻Anthropic办公室,按阿莫迪的说法,他们的“工作空间、工具和权限,跟公司内部风险评估团队差不多”。最接近的类比来自银行、核电与部分重工业,嵌入式评估员本就常见,但“常见”不等于“有效”。
布鲁金提醒评估员有陷入“文化俘获”的风险——不知不觉间,把被评估公司的利益置于自己对公共利益的责任之上。在AI政策领域,这一风险格外尖锐:最够格的AI评估员,几乎必然与他们要评判的公司有着密切的社会、财务和理念上的纽带。
六、速度该由谁定
大西洋理事会技术项目下属“民主+科技倡议”常驻高级研究员康斯坦丁诺斯·科迈蒂斯(Konstantinos Komaitis)最直接。AI大佬们一起喊停,信号意义很大。但真正的考验只有一个——这些承诺,能不能扛住当初把AI竞赛搞得这么凶的那股竞争压力?
自愿承诺是个信号,但代替不了三样东西:独立监督、可衡量的阈值,以及越线之后的后果。没这三样,“减速”无法落地。
他点出另一个被冷落的问题:美国与其盟友,到底有没有制度能力判断AI研发何时已不安全?大西洋理事会正在做的研究显示,全球AI安全和安全生态正在冒头,却高度不均。技术能力集中在少数国家手中,安全研究所和研究组织越建越多,但协调却没跟上。监管者管不了自己测不了、看不懂的东西。国际社会已在通过AI安全研究院与评估组织织网,在建设配套能力,但仍呈碎片化。
所以科迈蒂斯说,国际合作不是再设机构,而是要建一套分布式的AI安全基础设施:共享评估方法、通用报告标准、相互对接的测试能力,以及把技术能力辐射到前沿之外的国家。他认为这步应由美国牵头:当AI已成为国家安全与地缘博弈的变量,行业已无权决定它的速度。
因此,华盛顿必须做出抉择:安全承诺究竟停留在企业自愿表态的层面,还是纳入一个更宏大的、由可信监督与国际协调构成的框架。答案不是让AI停下来,而是建设一种能力——知道它该在何时、何地、为何慢下来。







