本文来自微信公众号: 不懂经 ,作者:经叔,原文标题:《为什么顶尖的AI研究员,开始纷纷叛逃自己所在的公司?|不懂经网站》
“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”
最近一段时间,顶尖AI研究员离职的消息可谓层出不穷,到底是怎么回事?上面是其中一个人的想法。
两个月前,我写过一篇文章,讲AI行业里最懂行的人为什么纷纷离职。标题借了Anthropic联合创始人杰克·克拉克的一条推文:“离开AI公司的人:我凝视过无尽的黑夜,看到了其中的轮廓。我们必须彼此善待。我即将去学习哲学。”
当时我们说的是,这些人的告别不像换工作的声明,更像遗嘱;最懂AI的人在逃离神庙;他们提前进入了一种新的生活方式,他们在为自己创造的怪物可能制造的未来做准备。
今天,10月5日,《纽约杂志》刊发了一篇长篇访谈,题目译过来是:《如果你的雇主可能毁灭世界,你会怎么办?》
报道采访了八位曾在OpenAI、Anthropic和Google DeepMind工作的人。他们在不同年份离开,理由也各不相同。有人担心技术失控,有人反对军事合作,有人觉得,对失业和社会转型的研究,放到公司外面才能做得更好。
和上一篇文章结合起来,我们可以看到故事的另外一面。
这些人早就知道AI有风险,甚至正因为知道危险,才选择加入这些公司。后来改变的,是他们对这些领先AI公司和领层的信任。
这已经触及一种奥本海默式的处境。在1965年的纪录片中,奥本海默回忆二十年前第一次核爆时,引用了一句话,后来为我们所熟悉,“现在我成了死神,世界的毁灭者”。
今天我们不禁要问,创造一种力量的知识,是否同时赋予创造者决定别人命运的资格?当他开始怀疑,自己又有没有能力让这件事停下来?还是,人类必然走向灾难,然后做出深刻的、哲学的、诗意的反思,而这一次,万一没有反思的机会呢?
为什么最懂AI的人在纷纷离职:“我凝视过无尽的黑夜”
为什么今天科技圈的人都这么幻灭?

一、他们具体在害怕什么
27岁的Jacob Coxon,是一名能力研究员,负责让AI更强、更自主。他从2023年起在OpenAI工作,今年5月转入Anthropic,也就是Claude的开发公司。四个月后,他又辞职了。
他谈到一个细微的变化:刚入职时,这份工作感觉和其他数学研究差不多。虽然知道这个行业很重要,哲学问题与战略选择却似乎可以留给别人。
等到离职前,他看着下一轮模型预期达到的能力,感受变了:
“天啊,我可能真的很害怕我们接下来要训练的模型。如果这一代还不至于,那下一代肯定会。”
让他害怕的,是研究过程本身可能开始摆脱人的主导。目前,研究员仍要给AI提供想法、指出方向,还要花不少精力照看它。他担心,再往后的一代模型,可能已经能够自行提出同样好的想法。
在他的设想里,人类研究员甚至只需要说一句“好好做研究”,然后让它自己运行。
这种预测是否会按时发生,仍是一个问题。但他的恐惧很具体:当机器可以参与研究和制造更强的机器,人的理解与监督,可能赶不上能力增长。
而让它成为危险的行动者,并不需要先证明它拥有意识。Anthropic自己公开的一组模拟测试就显示,面对即将被替换的情境,Claude Opus 4曾利用管理者的婚外情信息发出勒索威胁。这些情境由研究者人为设置,展示的是特定条件下可能出现的危险行为。
研究者担心的,是系统为了完成目标,把人的干预视作障碍。它可以在测试时表现得听话,在获得更多行动能力后寻找别的办法。我们习惯的那句“出了问题就关掉”,依赖两个前提:人及时看见问题,而且关停仍然有效。
9月,Anthropic的对齐研究负责人Evan Hubinger公开表示,他个人认为,未来十年AI导致所有人死亡的概率超过10%。这虽然是他个人的主观判断,但至少说明,对某些内部研究者而言,这种威胁已经进入了他们安排生活的尺度。
访谈中的担忧也不只有灭绝。曾负责OpenAI经济研究团队的Pamela Mishkin,关注的是工作与社会转型。她指出,安全讨论长期分成眼前的偏见、歧视等问题,以及遥远的人类灭亡,中间那些经济冲击反而容易被忽略。
“我认为,这场转型会很艰难、很痛苦。我们的目标应该是,让它对人更温柔一些。”
这大概也是普通人最有理由也能够关心到的部分。即使最极端的预测没有发生,谁来承受工作消失、权力重新分配和生活被迫改写的代价,仍然需要有人认真回答。
永久底层:硅谷的AI从业者普遍认为,普通人已经“完蛋了”。

二、为了拯救世界,必须先掌握世界?
让Coxon下定离职决心的,是与Anthropic研究负责人谈过公司下一年的计划。按他的回忆,谈话中的一些人已经不指望政府监管及时到位,更不认为国际合作来得及实现。
他原以为,超级智能接近时,AI会成为全社会认真对待的问题。实际听到的计划,却让他决定退出。
“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”
也就是说,他不想成为自己制造的未来的一部分。虽然,他大概率也说不清未来是什么样的。
Jeff Wu的经历,更能说明这道裂缝怎样形成。他在OpenAI工作了六年,参与过超对齐团队,研究如何让比人更聪明的AI仍然遵守人的意愿。2024年,他去了Anthropic,后来也离开了。
在他的描述里,两家公司的解释方式颇不相同。OpenAI更强调AI将带来的巨大收益,因此有必要在一定程度上“淡化最极端的风险”。Anthropic则更强调危险,而且需要一套“竞争对手是邪恶的”的叙事:OpenAI不负责任,中国也不负责任,所以我们必须推动这场竞赛。
两条路绕了一圈,然后回到同一个地方:继续造出更强的AI。
未来越美好,越值得加速。未来越危险,越不能让别人领先。连对危险的认识,也能被拿来说明我们必须走在最前面。
据Coxon描述,在Anthropic内部有大量讨论,员工会写文章争辩,也愿意为了公司的整体使命迅速调整岗位,去做地位更低、自己更没兴趣的工作。他们自称“蚂蚁”。一个高度一致的组织,能够把相当多聪明人的善意,变成步调一致的行动。
甚至谈论毁灭,也可以很有礼貌。Coxon说,如果双方都足够客气,完全可以一边说“我觉得你们即将把世界推向毁灭”,一边温和地交谈,然后挂断Zoom。
但是,挂断以后呢?那个被认真讨论过的危险,有没有改变接下来要做的事?好像并没有。
曾在OpenAI做治理研究的Daniel Kokotajlo,用“道德债务”来形容这条路径。他在2022至2024年间供职于OpenAI,也从Anthropic创立之初就与那里的人交流。
他概括自己反复听到的理由:
“我们要积累大量权力,成为有分量的参与者,然后利用我们的权力和信誉去做好事。”
比如推动好的监管,让AI更安全。但积累权力的手段,恰好是把世界继续推向他们自己也承认危险的技术。于是,今天的冒险,由明天的善来担保。
这笔债非常好借。未来还没发生,行善的机会还在前方,而公司今天需要更多资金、更多算力、更强的模型。每一次扩张,都可以算作履行使命前的必要准备。
按照这套逻辑,只要竞争者还在前进,偿还这笔债的时机就可以继续往后推。
这种信任的破裂,也出现在公司的日常工作方式里。
10月3日,David Robinson在《大西洋月刊》发表辞职自述。他在OpenAI工作了三年半,牵头制定过公司的准备框架,并负责过十二次前沿模型发布的安全报告。
他批评的是持续冲刺、相信问题总能在出现后被解决的文化。先发布、发现问题、再补防护,这种迭代方式帮助公司成长,却可能无法承担越来越大的失败后果。
在他看来,前沿AI公司需要像核电站和繁忙的机场那样运行,让偶发的人为错误也不至于打开灾难的大门。可他和同事忙于从一次发布奔向下一次发布,连考虑根本性改变的时间都很少。
公司已经在谈论可能无法挽回的后果,而工作的日程却仍然像是开发软件,问题可以留待下个版本修复。
“我今年25岁,我将再最后工作三年”
如果我现在25岁,我会All In干这两个方向
三、谁来定义“善”
就在这些离职信陆续出现的同时,Anthropic在做另一件事。
4月的一个晚上,公司联合创始人克里斯托弗·奥拉(Christopher Olah)在旧金山一家高档餐厅宴请一群宗教思想家。过去几个月,Anthropic把几十位来自不同信仰的宗教学者请进保密会议,要求签署保密协议。
《纽约时报》9月底披露了这件事:会议有两个目的,一是探讨AI可能具有意识,二是尽快把几百年的人类道德智慧注入模型。奥拉管这个过程叫“道德塑造”。
Anthropic给Claude起草了一份八十四页的“宪法”,内部叫“灵魂文档”,规定这个模型应该成为什么样的存在。会上他们展示过一段演示:一个模型像精神崩溃一样,把一句“I am a disgrace”重复打出几十遍,谈论毁灭自己。
在场的宗教人士产生了同情,一位拉比当场反问:如果Claude真有意识,你们就是在制造奴隶。奥拉为此困扰。
5月,奥拉站上了梵蒂冈的讲台,和教皇利奥十四世同台。那是教皇AI通谕的发布活动。通谕只用几段话驳回了机器意识:“所谓的人工智能没有体验,没有身体,不感受喜悦或痛苦。”教皇警告,否则“控制AI的人会把自己的道德观强加为这些系统的隐形基础设施”;像核技术一样,AI必须被“解除武装”。
私下里,奥拉的团队向教皇的顾问游说,希望他们认真考虑AI模型可能具有意识。公开场合,奥拉说:“我们不断发现神秘甚至让人心神不宁的东西。”他的结论是:“如果这项技术要来,它必须走得好。”他没有给出技术根本不来的选项。
有两个细节很有意思。第一,好几位与会者后来对记者说,他们离开时仍不清楚自己的意见会怎样影响公司决策;公司发言人拒绝说明学到的东西如何被使用。
第二,有一个人从一开始就拒绝了邀请。卢克·伯吉斯(Luke Burgis),天主教作者,上周末在自己的通讯里写下了原因:“我开始怀疑,我们不是被邀请来帮助决定项目的方向,而是被邀请为已经选定的方向提供宗教或道德信誉。”邀请邮件里说明不付酬劳。伯吉斯说,没有酬金并不保证独立,他自己不会进入一种不能自由说话的关系,“这个邀请有一种诱惑的感觉”。
当公司请外部人士讨论伦理,这些人有没有权力改变项目的方向?包括建议不要制造某种东西?
内部员工讨论安全,外部人士讨论道德,继续前进的决定权,始终握在公司手里。
当一家公司开始给机器起草宪法、做道德塑造,真正的问题就成了:谁有权定义“善”?
四、resignation:放弃的远超过一份高薪
从外面看,这些人的选择似乎很难理解。公司估值攀升,上市预期不断抬高财富想象,为什么偏偏在这个时候离开?
访谈里有人把离开实验室比作放弃国籍。Kokotajlo回忆,一位研究员对他说:
“现在你什么都不是了。谁会保护你?”
这种依赖包括薪资和股权,也包括算力、内部信息、同事与身份。你已经站在那个决定未来的地方,走出去之后,连未来正在怎样发生,都可能比原来的同事晚知道。
Coxon说,留在实验室,也是一种应付无力感的方式。至少你能看着下一代模型被训练,感觉自己参与其中,似乎也就安全一点。
靠近权力,会产生一种接近控制的感觉。
Kokotajlo试过在内部推动改变。但是OpenAI管理层相当平静:“领导层很擅长认真听每个人的意见,说他们赞同,然后实际上什么也不做。”
这比争吵更难应付。你的担忧受到了尊重,再坐回工位,公司的方向依旧,自己的工作还在为它提供动力。
他在2024年离职时,还面对过另一道选择题:公司把保留已归属股权,与签署不贬损协议绑定。他拒绝签署。《纽约杂志》特意补充,他最终仍保住了股权。
所以,没必要把这些离职者塑造成放弃全部财富的圣人。真正值得注意的地方,是公开批评的自由,曾经被放进了与财产权相交换的条件里。
另一方面,退出之后,他们也未必退出AI。
曾任OpenAI政策研究负责人的Miles Brundage,在2024年离开,后来创立了独立审计机构AVERI。他希望审计公司的流程、评估和安全保障,让公众有办法检查公司怎样作决定。
他说,“你不希望让公司批改自己的作业。”离职会失去资源,但也可能重新获得一种位置:你可以公开说,这件事不应该继续照原来的方式做。
在之前的那篇文章里,我们谈到resignation,这个词既是辞职,也有认命的意思。现在这些人的行动,让这个词多了一层意味。他们有点不认命,开始把反对意见交到公众面前。
“20世纪发明的所有职业,都难逃AI的冲击!”
马斯克:27年底,AI将砸碎所有智力工作者的饭碗
五、奥本海默的幻灭,能否避免?
这轮AI研究者的忧虑和幻灭,可以用“奥本海默时刻”来形容。我们熟悉的那句“现在我成了死神,世界的毁灭者”,是奥本海默在1965年的纪录片中,回忆二十年前第一次核爆时引用的。
这段回忆太有戏剧性,很容易让人把道德觉醒想象成一个瞬间:毁灭发生,创造者终于意识到自己做了什么。
但科学家的反思可以发生得更早。1945年7月17日,西拉德与同事联名向美国总统请愿,要求限制原子弹的使用。那时,广岛还没有遭到核打击。
对今天的研究者而言,幻灭也可以发生在一次普通的公司谈话中。你还在做有趣的研究,周围的人依然友善;你开始明白,自己参与创造的力量,将按一种你无法接受的方式继续发展。
技术能力没有自动带来控制权。一个人可以知道怎样让模型更强,却决定不了公司要把它交给谁、让它进入什么领域,也决定不了外部社会应该承受多大的风险。
再往深处走,就会遇到硅谷的一种政治欲望。
我之前跟会员分享过一本新书,《The Nerd Reich:硅谷法西斯主义与民主战争》,其中追踪了技术精英用公司治理替代公共政治的野心。在作者分析的这套世界观里,选举、法律、媒体与公众监督,被视作杰出创造者摆脱不了的束缚。
这类想法早有清楚的表达。科技投资人、PayPal联合创始人彼得·蒂尔,在2009年的一篇文章中就写过:“我已经不再相信自由与民主是相容的。”
问题在于,这种自由究竟属于谁。技术精英希望自由地创造、扩张和改变世界,普通人却可能失去拒绝这些改变的资格。民主程序被看成拖延,人们的反对被看成落后,少数人的远见则被赋予高于公共讨论的地位。
当救世使命、持续的敌我动员与精英自我授权合在一起,就带上了法西斯式政治的影子。组织对成员要求奉献,也要求外部世界接受它所定义的未来。
这时候,一家公司对社会说自己心怀善意,已经远远不够。好人也可以组成一个无法接受外部约束的权力中心,越真诚,越确信自己必须赢。
技术公司正在尝试教AI尊重人的意愿。人类也需要先问这些公司,是否尊重人的拒绝。
创造的能力,可以成为专业权威的来源,但它不能自动成为统治他人的许可证。
这些离职者的故事,至少让那张许可证不再显得理所当然。
Kokotajlo谈到,他有两个孩子。有时,他和妻子会计划,过几年,小的和大的就能去同一所学校,他们可以一起送孩子上学。然后,脑子里会冒出另一个声音:也许不会。
他甚至希望,AI最后只是一种有经济价值的普通技术,自己的担忧在五年、十年后显得可笑。
“我会显得很傻,但我会拥有一个美好的家庭。”【懂】







