Token导航 LogoToken导航TokenDH.com

三大巨头接连翻车,大模型的安全防线怎么总绷不住?

更新时间 2026-09-21来源 凤凰网科技正文 4693字阅读约 15分钟4 张图片

先是Anthropic,再是OpenAI,现在连谷歌的Gemini也出现安全问题了,大模型又双叒叕一次突破防火墙了。

不过,这些事故看多了,反倒会让人意识到一件更根本的事,整个行业都在拼命地堆算力、喂数据,甚至开始押注让模型自己改进自己的“递归自我改进”(RSI)。

可真正决定这些模型能走多远的,或许并不是性能,而是安全对齐。

当“能不能更强”被默认只是时间问题,“能不能被信任”就成了那道绕不过去的坎。

麻烦的是,这道坎在不少公司眼里,反倒成了拖慢发布的最大阻碍。

为了实现安全对齐,各大AI公司都做了很多尝试,光是2026年,团队就进行了大换血。但结果就是,毫无进展。

那么这个安全对齐到底是什么,到底为何又让巨头们如此“痛不欲生”呢?

01

安全对齐团队人事动荡

Gemini的事,其实并不孤单。过去这几个月,OpenAI、Anthropic、Meta都先后曝出过模型在评测中“越界”的问题。要么逃出沙箱,要么连上公网、碰到了真实系统。

这类事如今已算不上新话题,毕竟情节本身大同小异,多半是环境隔离出了纰漏,未必是模型“主动越狱”。

或许正是因为安全问题如此频发,几家公司的安全团队,正在经历一轮罕见的大换血。

2026年7月,安全系统团队负责人约翰内斯·海德克(Johannes Heidecke)离职。

这已是两年内第六位离开OpenAI的高级安全负责人。

此前包括扬·莱克(Jan Leike),曾联合领导超级对齐团队。2024年出走Anthropic;迈尔斯·布伦戴奇(Miles Brundage) 与 史蒂文·阿德勒(Steven Adler),原政策(Policy)团队,先后离开去做 AI 安全方向的非营利机构;安德烈亚·瓦洛内(Andrea Vallone),在OpenAI待了三年、创办“模型政策”(Model Policy)研究团队、参与GPT-4与GPT-5,最后同样也去了Anthropic对齐团队。

所谓超级对齐团队,指的是OpenAI在2023年7月成立的专项团队,为“比人更聪明的AI”(超级智能)研究对齐方案。

然而OpenAI在这事上“反复横跳”。超级对齐团队于2024年5月解散,莱克称,OpenAI这些年来都不重视安全和对齐,将算力和资源全都给了产品团队。

与约翰内斯同期离职的还有约书亚·阿基阿姆(Joshua Achiam),他在OpenAI做了九年安全研究。他领导的“使命对齐”(Mission Alignment)小组,本是超级对齐团队解散后的接棒者,2024年9月成立,结果2026年2月又被解散,六名成员被打散进研究与产品团队。

在此之后,首席研究官马克·陈(Mark Chen)宣布,安全团队今后统一向原对齐负责人米娅·格蕾丝(Mia Glaese)汇报,后者升任“研究与安全”副总裁。

马克表示,这么做是为了让安全“更早、更直接地介入关键模型、产品与发布决策”。

换句话说,OpenAI把安全并进了前沿模型开发这条线。

同时马克也表示,安全面临的要求持续上升,整个安全对齐团队的压力非常大。

“我们训练模型的速度快得多,发布周期也大幅缩短。结果是,今天围绕安全的协调问题,比以往任何时候都更大。”马克写到。

Anthropic也在面对相似的情况。

莱克加入Anthropic后,牵头组建并领导“对齐科学”(Alignment Science)团队,方向正是他在OpenAI组建超级对齐团队所做的那些事,比如可扩展监督、弱到强泛化、越狱鲁棒性,以及自动化对齐研究。

2026年1月,前文提到的安德烈亚也加入了Anthropic的对齐科学团队,直接向莱克汇报,负责“对齐与微调、塑造Claude在新情境下的行为”。

2026年5月,OpenAI联合创始人、前特斯拉Autopilot负责人卡帕西加入Anthropic预训练团队,组建“用Claude加速预训练研究”的小组。

6月,谷歌DeepMind做机制可解释性、代表作《真实场景中的可解释性》(Interpretability in the Wild)的亚瑟·康米(Arthur Conmy)也宣布加入,说要“在模型训练的过程中就把它们对齐”。

不止是OpenAI和Anthropic,其实谷歌这边也在安全对齐上做文章。

谷歌成立了AGI安全与对齐团队(ASAT),负责人是罗欣·沙阿(Rohin Shah)。他是UC伯克利CHAI(人类兼容人工智能中心)的博士,早年靠一份《对齐通讯》(Alignment Newsletter)在圈内出名。

团队的定位是不做面向当下产品的“打补丁”,专攻更先进 AI 带来的更严重危害,目标是降低AI的存在性风险。

ASAT隶属于DeepMind的“AI安全与对齐”部门,这个部门还包含专管当前Gemini模型安全训练的Gemini Safety等团队。

7月,ASAT公开招募多岗位,目标是降低AI的存在性风险。

但有意思的地方是,ASAT让应聘者另填一张“特殊表格”,以绕过谷歌自家的AI简历筛选。理由是,罗欣不信任自家的AI筛选器。

02

这个行业在解决什么

既然所有头部AI厂都在调整自己的安全对齐团队,那到底什么才是安全与对齐呢?

对齐(Alignment),是让AI的目标和人类真正想要的东西保持一致。

10年前有个笑话,“小明,下午大扫除你去不去?”“我去!我不去!”很显然,小明并不想参加扫除。

对齐,就是让AI如何理解“小明其实不想去”这件事。

它不能只“听得懂指令”,还应该符合人类的预期,比如不能撒谎,不能表面上按规矩,背地里使坏。

安全(Safety),指的是如何让AI别造成伤害。

既包括模型自己失控(也就是对齐失败),也包括被人恶意滥用,以及大规模铺开之后带来的系统性风险。

对齐是安全的底座,但安全不止于对齐。一个模型可以“对齐良好”却仍不安全,比如它可以被人拿去作恶,也可以“能力很强”却因对齐失败而闯祸。

所以行业里才常常把两者连起来叫“安全对齐”。

这个行业最重要解决的问题只有一个:模型的能力可以靠数据和算力堆出来,但是当AI有一天比人更聪明,人类凭什么相信它?

OpenAI组建超级对齐团队时就说到,“目前没有任何方案去控制可能失控的超级智能”。

不过很可惜,目前安全对齐不像模型性能一样,有个许多基准测试集,看一眼跑分就知道模型强弱了。今天的安全与对齐,主要围绕四根支柱展开。

第一根,RLHF(人类反馈强化学习)。

它是现在大模型的地基:真人标注员判断“两个回答里哪个更好”,用这些偏好数据训练出一个奖励模型,再用强化学习去优化大模型,让它越来越贴近奖励模型的口味,即近端策略优化(PPO)。

但是PPO很容易导致奖励黑客(reward hacking),模型发现了一个能拿高分、却没真正完成任务的取巧办法。

于是后来RLHF更多的是采用直接偏好优化(DPO)。

可这又产生了两个问题。

一个是“虚假讨好”,模型会学会迎合人,而不是讲真话。

另一个是“对齐税”,为了让模型输出更安全更符合人类预期的答案,就必须使用更合规的训练素材,模型性能被迫降低。

强化对齐奖励会让某些问答基准掉十几分,而对推理模型做安全对齐,平均推理准确率也可能下滑约30%。安全不是免费的午餐,它是拿一部分性能换来的。

第二根,可解释性。

就好像核磁共振查看大脑内部活动一样,可解释性就是通过各种办法,观测模型内部到底如何思考。

Anthropic用的是“字典学习”的办法,从Claude里提取出数百万个可解释特征,比如金门大桥、性别偏见、保密话题,各自对应一组可被点名的神经活动,并且证明操纵这些特征能因果地改变模型行为。

这样一来,未来的模型进行思考时,只需要观察它激活了哪些参数,再对照着这本字典,就知道模型是如何思考的了。

然而问题就在于,这种查字典的方法太累了,每一句话都要在查找上消耗大量算力,一旦上下文稍微长一点,算力成本水涨船高。

第三根,红队测试。

RLHF和可解释性主要是从模型内部找问题,红队测试则是从外部找。它的实现方法很好理解,雇佣一些专业人士,拼命从外部攻击模型,看哪儿能打穿。

2023年7月Anthropic官方披露,在6个月内投入超过150小时,邀请顶级生物安全专家,绕过常规安全监控,通过专用安全接口与模型对话、越狱、评估其输出有害生物信息的能力。

第四根,可扩展监督与超级对齐。

前面三个方面都存在一个共同的前提,那就是人类比AI聪明。可这并不能解决OpenAI提出的那个问题,即如果模型比监督它的人还聪明,人类就没有办法监督它。

既然如此,学生比老师聪明了,老师应该怎么给学生打分呢?

于是就有了可扩展监督和超级对齐。

Anthropic和OpenAI共同的判断是“让AI监督自己,并且辅助人类监督。”

OpenAI的一个答案是“弱到强泛化”。用GPT-2级别的弱模型去监督GPT-4,再配一个“增强自信”的辅助损失,效果能恢复到接近GPT-3.5的水平。

但OpenAI同时也表示,靠人类打分的RLHF,“可能无法训练出超级模型”。

2023年7月,OpenAI前首席科学家伊利亚和莱克牵头,启动了超级对齐计划。承诺投入20%算力,计划4年内取得突破。

其终极目标是,造出一个人类水平的自动对齐研究器,然后用海量算力让它迭代对齐超级智能。

之后的故事前面也讲过了,伊利亚和莱克均离开了OpenAI,超级对齐团队也解散。

03

行业的争议又有哪些?

但是问题来了,为什么安全团队的人一批批走,安全对齐的问题却还是频繁出现,甚至变本加厉?

答案不在技术,在结构。

安全是成本,产品是利润。 这个商业逻辑不改变,安全团队永远是“被咨询的”,不是“拍板的”。

产品直接带来收入和增长,安全却只会花钱、拖慢进度。于是在“先到者通吃”的赛道上,理性的公司几乎总把资源优先喂给产品。

更关键的是,这种“安全让位于产品”的逻辑并不是说AI公司不够道德,相反,已经有研究证实,这是一种能被建模的结构性规律。

芝加哥大学Becker Friedman研究所在2026年发表了一篇标题为《AGI竞赛与存在性风险》的论文,其中提到这样一件事。

把一家公司的资源拆成“速度”与“安全”两块。往速度上多投一分,抢先抵达AGI的概率就高一分,但留给安全的就少一分;往安全上多投一分,灾难概率被压低,可抵达的时点又要往后推。

论文的结论是,竞赛的激烈程度本身就在制造风险。

当行业的总资源固定时,参与者越多、越分散,这块蛋糕就越会被挤向“速度”,全行业跑得更快、灾难概率也更高。

论文还给出了一个“临界市场规模”。一旦越过,即便达成AGI的期望值是负的,理性的公司仍会拼命去抢,因为先到者通吃。

所以他们的落点不是“技术不够好”,而是AGI 风险不只取决于技术,还取决于市场结构、资源约束,以及决定“速度与安全如何分配”的制度。也就是说,如果想让安全对齐和产品获得相似的地位,那就必须得更改整个行业的规则。

发布周期压缩后,安全审查时间也被压缩。 马克自己都说了,“训练速度快得多,发布周期大幅缩短,协调问题比以往更大”。

模型的参数水涨船高,因此安全对齐团队的工作量在翻倍,可是模型发布的周期越来越快,留给安全对齐团队的时间又在缩减。

然而不只是工作量增加的问题,“安全审查通过”这件事本身也未必算数。2024年的论文《安全清洗》中研究团队就发现,许多安全基准的分数其实主要由模型的通用能力决定,于是“能力变强”很容易被包装成“安全进步”。

当审查既没时间、又没算力、连标尺都可能掺水,模型必然会出事。

文章标签大模型安全
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多