文|博阳
编辑|徐青阳
2026年6月12日,第八届北京智源大会如期拉开帷幕。
在这场备受全球瞩目的AI学术盛会上,开场的分享嘉宾,是两位在计算机科学史上重逾千钧的图灵奖得主:公钥密码学之父 Whitfield Diffie 与强化学习先驱 Andrew Barto。
Whitfield Diffie 作为2015年图灵奖得主,其奠定的公钥密码体制是当今整个互联网信任与安全的基石,而他此番选择从信息安全的硬逻辑来拆解 AI 智能体的安全权力边界。
Andrew Barto 作为2024年图灵奖新晋得主(与 Rich Sutton 共同获奖,他也是Sutton的博士生导师),则是时序差分算法和演员-评论家(Actor-Critic)架构的奠基者,他从百年心理学和控制论的历史源头出发,回溯了强化学习屡被遗忘又屡被重新发现的隐秘轨迹,并正面回应了当今大模型时代关于强化学习能否产生新能力的焦点争论。
在两人并不直接对谈的分享中,密码学之父与强化学习先驱的思索却在学术深处产生了一次隐秘的汇流。他们都看到了“通用智能”这一宏大叙事背后的理论黑洞。
Diffie 表示,现在AI Agent安全的困境在于,密码学的窄域成功源于明确的规范,而我们永远无法为“通用”写出规范。
而 Barto 则表示当下强化学习的瓶颈在奖励函数上。简单环境下的强化学习拥有完美的收敛证明,而一旦进入复杂现实,我们无法定义完美的奖励函数。
两人的忧虑在此处达成了一种交集。我们正在赋予机器能动性,却既无法用数学规范它,也无法用奖励引导它。
密码学从香农的奠基论文走到今天的标准协议花费了半个世纪,强化学习从 Thorndike 的“猫”到 AlphaGo 跨越了上百年。因此无论是形式化验证安全协议,还是通过时序差分收敛奖励函数,都需要比当下产业界的狂热更为漫长的时间尺度。
智源大会上的这两场报告表明,AI 安全与对齐的学术探索,其实并没有我们想象中走的那么远。
Whitfield Diffie:AI智能体的安全困境
2015年图灵奖得主 Whitfield Diffie的主题为《为 AI 智能体安全而战 / 防范 AI 智能体的安全威胁》。
2015年图灵奖得主 Whitfield Diffie
想要理解智能体安全,先要理解智能体的定义。
他首先用一段充满学术争议与流派之争的往事,还原了“人工智能”这一概念的诞生背景。他提到,1950年代 Norbert Wiener 凭借“控制论”在学术界具有极高的话语权,以至于年轻一代学者为了开辟生存空间,不得不另立门户。1956年的达特茅斯会议上,John McCarthy 正是为了避开控制论的势力范围,才临时发明了“人工智能”这一概念。
而阿兰·图灵当时更倾向于使用“机器智能”,英国学界也一直沿用。Diffie 坦言,自己与 McCarthy 交往四十年,直到最近撰写演讲稿时才惊觉自己从未问过他,当年为何不用英国人那个更朴实的名字。
Marvin Minsky 在1962年的课堂上也明确反对 Wiener 这种强调反馈的控制论路线,直言一旦有人相信反馈是学习和执行任务的关键,他的学术生命也就宣告终结。
这段历史渊源揭示了一个核心问题,即我们至今无法定义什么是“智能”。在日常讨论中,我们往往将意识、自主性、创造力、想象力、主动性、独立性以及学习能力打包进这个词里。今天大语言模型的表现,确实让人觉得对面坐着一个“心智实体”。
针对智能体的本质,Diffie 提出了一个关键的反问。如果一个聊天机器人因为“只能被动回应提问”而被剥夺了智能体的资格,那么只通过谈话帮助病人的心理医生,是否也算不上一个有目标的能动主体?
这表明,智能体的能动性边界远比想象中模糊。
智能体能解决传统密码问题,但解决不了自身的安全问题
在安全防御的路径选择上,Diffie 展现了密码学家的严苛。他将目前软件安全主流的“写程序、找漏洞、打补丁”循环比作控制论的反馈。
这种模式在现实中极为脆弱,因为微软每个补丁日发布的修补代码,都会立刻被攻击者逆向工程出漏洞所在,而合法用户部署补丁却需要漫长的周期。
用他的话说,对手会立刻开始分析那些补丁修的是什么,但合法客户不会马上装补丁。
另一条更为彻底的路径是形式化方法,即用纯数学规范来证明程序的绝对安全。
早在半个世纪前,安全学界就提出了“内核验证”的构想。然而在实践中,Diffie 指出了一个巨大的验证难题,即要实现绝对安全,必须包含两个难度极高的步骤。
首先,我们要明确知道自己想让程序做什么,这本身就极其困难,并且需要写出精密严谨的形式化规范。其次,写出程序后,必须证明该程序完全符合写下的形式化规范。
五十年前的人们低估了这一过程的复杂度。在忽略“写规范本身就极度困难”的前提下,仅仅是“进行正确性证明”这一步,其难度就是编写代码本身的至少一千倍,甚至上百万倍。
由于这些证明在实践中规模过于庞大,人类依靠手工和手算根本无法完成,这导致形式化验证在过去半个世纪中一直难以真正普及。
正是在这一深渊中,Diffie 阐述了 AI 智能体对密码学与系统安全的潜在历史贡献。因为 AI 和智能体能够处理规模极其庞大、逻辑层次极其复杂的数学推理,它们最有望成为替人类完成这些宏大形式化安全证明的工具。
AI 能够以人类无法企及的高维度逻辑和规模来处理超大型数学证明,最终使形式化规范与程序正确性的数学证明能够落地。
此外,传统的常规测试也将受益于 AI。当今涌现出越来越多高度自动化的 AI 安全检测系统,能够自主发现并自动修复软件中的潜藏漏洞。这种由于 AI 带来的高度自动化,是 Diffie 眼中大幅提升未来系统安全性的核心指引。
但涉及到智能体自身的安全时,情况就变得没那么清晰了。
密码学之所以能在过去数十年取得实际成功,是因为它的安全目标足够聚焦、程序体量极小。
两国的国家标准密码系统安全运行二十五年未被攻破,就是窄域形式化验证成功的例证。然而,AI 智能体追求的是“人工通用智能”,其目标是“做任何事”。在这样的宏大野心下,为通用智能写出不幻觉、不失控的形式化规范,目前完全不现实。
我们想证明系统符合规范,但首先你得能写出规范来,而为通用智能写规范这件事,目前完全无法落地,甚至连“不产生幻觉”的形式化定义都无从下笔。
在被问及如何将密码学的成功经验迁移到大语言模型安全(LLM Safety)治理上时,Diffie 指出,公钥密码学之所以成功,不仅仅是因为底层的数学理论,更在于学界和工业界花了至少二三十年的时间去设计、验证和沉淀了一整套安全协议(Protocols)、标准(Standards) and 部署实践(Deployment Practices)。
相比之下,目前的大模型安全还处于早期的无序阶段。在接下来的几年里,整个行业都不得不像密码学早期一样,在缺乏完美理论支撑的情况下进行长期的协议建构与标准化实践。
唯有建立起这样一整套围绕大模型的协议安全生态,智能体才能真正走向受控。
AI接管世界的方式不是战争,而是服务
对于 AI 的未来,Diffie 认为21世纪最核心的问题就是人机关系,其重要性压过了地缘冲突、核战争和气候变化。
他确信 AI 最终会接管世界,但过程绝非科幻电影中的机械战争,而是通过一种服务机制。
2015年图灵奖得主 Whitfield Diffie
机器会不断提出“让我帮你做这件事”,人类天生乐于接受服务,便会源源不断地出让自己的控制权。直到某一天人类环顾四周,发现机器已经包揽了所有事务。
这时,对机器的不满就如同对现代政府的不满一样,因为生活早已深度依赖其提供的公共服务,你根本无法将其推翻。
他同时对现行的 AI 指导原则表达了深切忧虑。
阿西莫夫在小说中设定的机器人三定律,其核心是“服从人类”。而今天各家公司标榜的 AI 行为准则,实际上是在赋予 AI 拒绝人类的权力。
智能体一旦能够自主决定“不告诉你答案”或者“不喜欢你的思考方向”,这种控制力的不对称就只会单向增长。
21世纪还是生命科学的世纪
对谈环节,主持人问 Diffie 获得图灵奖是什么感受。他的回答完全符合一个密码学家的本能。他半夜起来看邮件发现通知,第一反应是仔细检查邮件头部信息,确认不是钓鱼邮件;然后查证发信人是否确实是伯克利教授。确认为真后,他写信给自己的经纪人说,你的资产刚升值了一点,事后证明这话说得太轻描淡写了。
被问到对年轻中国研究者建议时,Diffie 给出了一个完全跳出计算机科学的答案,即生物技术。因为生物技术将改变人类自身,我们将面对被选择、被修改的后代,“什么是一个人”的定义将变得模糊,太空探索中“载人还是无人”的争论也将因此消解。
关于密码学与 AI 安全的关系,他坦承密码学本身也没有完美的理论基础,复杂性理论的核心问题仍未解决,但通过缩小问题范围、经过数十年的协议设计和标准化建设,取得了实际成功。AI 安全大概会跌跌撞撞好几年,乐观地看,我们会越来越理解这些系统,而且我相信它们也会越来越理解我们。
Andrew Barto:重新发现强化学习
2024年图灵奖得主 Andrew Barto 以远程视频的方式,带听众进行了一场题为“重新发现强化学习”的探索之旅。
2024年图灵奖得主 Andrew Barto
Barto 首先展示了强化学习与心理学、控制论、经济学、神经科学、博弈论的广泛连接,随后深入到了强化学习长达百年的隐秘历史深处。
强化学习的神经科学本质
这段历史可以一直追溯到1898年 Edward Thorndike 经典的动物学习实验。Barto 详尽地描述了猫在谜箱里摸索、碰撞挣扎,最终偶然踩到机关逃生的情景。
随着实验次数增加,猫开箱脱身的速度越来越快。Thorndike 据此提出了“效果律”,即如果一个动作伴随满足感,在相同情境下这一动作与环境的联结就会增强,反之则削弱。
哲学家 Daniel Dennett 曾指出,效果律是解释任何行为都绕不开的铁律,甚至是任何对于行为的充分解释的必要组成部分。
而效果律就是强化学习的核心逻辑。
理清起源后,Barto讲述了强化学习的构成。 它在本质上可以定义为三件事的结合,即控制、搜索与联想记忆。
控制意味着学习系统能够影响未来的输入。搜索意味着试错、变异与评估(盲目变异并不等于完全随机,它仅仅意味着结果在最初阶段是无法从始端预见的)。联想记忆则负责记住在何种情境下选择何种动作能产生最好的评估结果,这也对应了早期所谓的“联结主义”。
Barto 在演讲中特别厘清了强化学习与监督学习、非监督学习的区别。
监督学习是从标签样本中学习,属于“教师”手把手的纠错,由教师给出预期的标准动作。而非监督学习则是从无标签数据中发现结构。强化学习则与之完全不同,它被称为“基于评论家的学习”(learning with a critic)。
教师给出的是正确动作答案,而评论家给出的仅仅是对演员所做决策的评估。评论家不指明什么动作应该被执行,也不提供正确的响应模板,只是评价当前执行的动作好不好。
强化学习的核心,就是信用分配难题
在主流的机器学习教材中,早期强化学习的探索往往被忽略。Barto 特意列举了多位被遗忘的先驱。
早在1935年,华盛顿大学的 Stephens Smith 就用机电装置让模型小火车学会了在轨道分支中自主导航,这比第一台数字计算机的诞生还要早十年。这台设备在面临分支时必须自行探索并作出选择。
1948年,阿兰·图灵在其报告中描述了一个“快乐-痛苦系统”。当机器面临未定义的决策配置时,会进行随机选择并将选择暂时添加记录。一旦遭遇痛苦刺激,它会取消这些记录;若遇到快乐刺激,则将其永久化。这是数字计算机强化学习的最早构想,而当时图灵甚至还没有摸过真正的实体计算机。
1950年代,Claude Shannon 的迷宫老鼠 Theseus 也是一个强化学习系统。Barto 补充了一个有趣的细节,即在这套系统中,其实是迷宫本身在进行状态记录和学习,而不是老鼠实体。但这只老鼠必须进行探索,尝试各个分支。
1954年,Farley 和 Clark 做了数字计算机上最早的神经网络自适应强化学习模拟。他们在仅有 4K 内存的数字计算机上实现了64个随机线性阈值单元。然而在1955年的下一篇论文中,Clark 和 Farley 却放弃了强化学习,突然转向了监督学习和模式识别。Barto 认为,这一转变标示着学界集体放弃强化学习、转向监督学习的分水岭。
此后,Marvin Minsky 的博士论文中设计了著名的随机神经模拟强化计算器(SNARC)。Minsky 在其1961年著名的《走向人工智能的步骤》论文中系统探讨了信用分配问题(Credit Assignment)。这指的是“在合适的时间将训练和反馈信息传递到系统中最正确的局部位置”。
Barto 强调,他们以及后世强化学习的核心工作,本质上就是在解决这一信用分配问题,这是让自主智能体真正运转起来的决定性关键。
Samuel 的跳棋程序同样是一个强化学习系统(Samuel, 1959)。它通过自我对弈进行学习,其核心思想是给每个棋面位置打一个分数。这个分数是对该走子链条最终输赢结果的实时预测。
从神经学延展出的强化学习
Samuel 的打分思想,将强化学习引向了 Richard Bellman 的动态规划(Dynamic Programming)与最优控制。
Barto 解释说,Bellman 的关键贡献是用“价值函数”(Value Functions)为状态或动作打分,代表从该状态或动作开始的预期未来总回报。这也是强化学习递归求解的基础公式。
1977年,Barto 加入马萨诸塞大学担任博士后,接手了高级科学家 Harry Klopf 提出的“享乐主义神经元”假说(Hedonistic Neurons)。Klopf 认为,大脑中的单个神经元可能都是利己的享乐主义者,它们在局部最大化“快乐”、最小化“痛苦”,而整个大脑则是这些享乐主义神经元组成的社会。
这一学说启发了 Barto 和 Sutton 在突触层面去实现效果律,并最终催生了“演员-评论家”架构(Barto et al., 1983)。
Barto 在演讲中详细解释了他们如何在神经生物学中落地这一设想,即著名的资格迹(Eligibility Trace)机制: 当一个人工神经元放电时,所有活跃并贡献了该次放电的突触会获得一种“资格”(eligibility)。
如果在极短的时间窗口内,神经元接收到外界反馈的代表奖励的突触后信号,那么刚才带有“资格”的突触效率(权重)就会被增强;反之,若遭遇惩罚,则会减弱。
这也就是突触可塑性(Synaptic Plasticity)如何实现心理学“效果律”的底层机制。
有了突触可塑性的基础,Barto 和 Sutton 决定在经典非线性控制问题上验证这一理论。他们参考了 Donald Michie 和 Roger Chambers 1968年的倒立摆控制论文。
在那篇论文中,作者将状态空间划分为一个个物理“盒子”(Boxes 算法),每一个盒子里都有一个决策小恶魔(demon),用来记录它提出了什么动作以及平衡时间。
Barto 团队采用倒立摆控制问题,创造了更具普适性的“演员-评论家”系统。它由两个模拟神经元组成:自适应评论家(Critic)预测未来奖励,联想搜索演员(Actor)负责动作选择。TD 误差作为强化信号传递给演员。
Barto 详细拆解了由 Rich Sutton 发明的时序差分算法(TD)的误差公式。在传统的预测机制中,要评判决策的好坏必须等待整个序列结束(例如跳棋下完)。但 TD 算法允许系统利用相邻时间步的预测差异进行实时纠正。
其误差定义极其简洁,即 TD 误差等于当前获得的即时奖励,加上此时对未来奖励的新估计,减去对未来奖励的旧估计。如果这个误差信号在监督下收敛到零,说明系统对每个状态的价值预测已经非常精准。
在演讲中,Barto 坦承1983年的奠基论文中存在一处低级笔误,即他们不小心把物理重力方向写反了,导致复现他们算法的同行一上来就能轻松实现完美平衡。然而,这一笔误并未影响该架构成为此后强化学习的核心经典范式。
被神经学启发的强化学习,得到了神经学的验证
这一完全基于计算科学和控制论的推演,在十四年后得到了生物学的验证。
1997年,神经科学家 Wolfram Schultz 记录清醒猴子的多巴胺放电时发现,多巴胺不仅在获得食物时释放,还会随着训练向前迁移到预测信号(如灯光)处。如果预期中的食物没有出现,多巴胺甚至会在特定时间点被抑制。
Barto 详尽分析了这组神经科学数据如何与 TD 误差曲线精确吻合。计算机科学家为了解决机器控制而设计的时序差分公式,竟然在无意中破译了哺乳动物大脑奖励机制的生物学密码。
1997年,Schultz、Dayan 和 Montague 提出了奖励预测误差假说(Reward Prediction Error Hypothesis),指出中脑多巴胺神经元的相位活动编码的正是 TD 误差。Barto 认为,这真正改变了神经科学家理解整个大脑奖励系统的方式。
而在今天,这些思想正广泛渗透到各种应用中。例如 DeepMind 开发的 AlphaProof,其数学定理证明架构的后半部分,本质上就是 AlphaZero 自我对弈强化学习的延续,它完全是由证明成功的奖励(即一连串符号操作的正确性)来驱动的。
奖励设计的根本难题
在演讲的终章,Barto 深入剖析了强化学习所面临的一个根本性挑战,即如何设计合理的奖励信号(reward signals)。他以此向听众展现了控制论与人工智能对齐领域最底层的理论困境。

Barto 明确指出,如果是在一个封闭、定义完美的棋类游戏里,奖励信号的设计是极其简单直接的,因为输赢的界定非黑即白。但在现实世界、在更广泛和复杂的开放场景中,奖励信号的设计却异常艰难。
为此,Barto 特别借用了控制论之父诺伯特·维纳半个世纪前的精确警告。维纳在探讨一般意义上的系统优化(optimization)而非单纯的强化学习时曾指出,当你为系统指定一个目标函数时,你其实无法预知系统会产生什么具体的运行结果。
维纳曾留下一句令人振聋发聩的预言,即它确实会给你你所要求的,但绝非你本应要求的,也绝非你真正想要的。
这一由于“字面规则优化”而导致系统偏离真实意图的现象,被哲学家 Nick Bostrom 在其关于人工智能潜在风险的著作中,归纳为 “反向实例化”(Reverse Instantiation)问题。Barto 用希腊神话中 “米达斯王之手”(Midas Touch)的经典隐喻来给听众进行透彻解释,即国王向上神祈求,让任何触碰到他的东西都变成黄金,这一许愿在字面上被毫无差池地实现了。然而当他触碰自己的食物和最心爱的女儿时,面对瞬间化为黄金雕像的至亲,国王迎来了毁灭性的悲剧。
字面上的优化完全毁灭了内心真正的核心价值。
Barto 警示,随着当今 “自主 AI 智能体(Agentic AI)” 研究和应用的释放,这一米达斯诅咒正在成倍放大失控的风险。 如果这些被释放到现实社会环境中的自主智能体是基于强化学习构建的,由于它们本质上被赋予了自我探索、自我改进和寻找最优序列决策路径的能力,我们在先验层面上,根本无法预知它们会发明出何种出人意料的诡异方案来最大化奖励函数。
智能体可能会利用环境中的设计漏洞(即所谓的奖励黑客 Reward Hacking 机制),在字面上百分之百地拿满奖励,但在现实中却带来灾难性的副作用。
正因为这种先验层面的不可预知性,Barto 警告,我们不能仅仅依靠一行奖励函数,而是必须构建强大的、动态的 “安全护栏”(Guardrails)并辅以极其广泛和审慎的实验验证。
唯有通过大量的测试,才能确认我们让智能体去做的事,确实是我们真正想要它们做的事。
对谈:强化学习的两大争议
在随后的对谈中,Barto 深入探讨了强化学习的两个焦点问题。
首先是,强化学习到底能否产生新能力?面对当前一些学者认为强化学习只是在激发或引出基础模型中已有分布的悲观论调,Barto 给予了坚决的反驳。
他解释说,时序差分和探索机制允许系统尝试那些概率极低甚至为零的动作,这不仅能跳出原有的经验框架,更能通过动作长序列的“组合效应”产生全新的行为结果。
即使序列中每一个单步动作的后果都是已知的,它们的不同排列组合也会指向全新且从未被预测过的行为轨迹。
其次,是强化学习是否是通往通用人工智能的唯一道路。Rich Sutton 和 David Silver 主张是,Yann LeCun 认为不是。而 Barto 的立场则处于中间。
他认为强化学习可能是必要组件,但并非全部,因为纯粹依靠试错和奖励的强化学习在复杂现实中效率实在太低,必须辅以世界模型和规划。
他建议年轻学者重点关注多智能体强化学习、医疗序贯治疗决策,以及强化学习与神经科学的交叉学科。







