
👦🏻 作者: Richard Sutton
🥷 编译: NCon
国庆假期,我们翻出几篇经典文章,推荐给大家。
想理解今天 AI 行业为什么如此相信 Scaling Law,我觉得《苦涩的教训》是一篇绕不开的文章。从大模型到具身智能,从业者在讨论技术路线时,反复提起这篇写于 2019 年的短文。
Richard Sutton 回顾了几十年的 AI 研究,指出一个让研究者不太舒服的规律:人类精心设计的领域知识,往往会在长期竞争中,输给能够持续利用更多计算的通用方法。
这也是今天许多人相信 Scaling 的重要思想来源之一:把时间尺度拉长,真正重要的不是一种方法眼下有多精巧,而是它能否随着算力增长持续进步。
所以,国庆期间我想推荐大家读一遍原文。它能帮助我们理解,今天许多 AI 从业者对未来的信心从何而来,以及这种信念如何影响他们选择问题、设计系统和投入研究。
回顾过去 70 年的 AI 研究,最重要的教训是:从长期看,最有效的,往往是那些能够不断利用更多算力的通用方法。
原因在于摩尔定律。说得更准确一些,是因为计算越来越便宜,单位算力的成本长期呈指数下降。
AI 研究项目启动时,研究者常常默认可用算力不会发生太大变化。在这个前提下,把人类掌握的知识写进系统,似乎是少数能够提升性能的办法之一。
但只要把时间尺度拉长一些——哪怕只比一个典型研究项目多几年——可用算力就会大幅增长。
为了在短期内做出成果,研究者自然会诉诸自己熟悉的领域知识。但从长期看,真正决定成败的,是一种方法能否持续利用越来越多的算力。
理论上,领域知识和计算并不冲突;现实中,它们却常常争夺同样的时间和精力。把时间花在一条路线上,就无法同时投入另一条路线。
而一旦在某条路线上投入太多,研究者也容易在心理上对它产生依恋。
更麻烦的是,把大量人类知识写进系统,往往会让系统越来越复杂,反而难以受益于那些能够利用算力的通用方法。
AI 研究史上,这样的例子比比皆是。
下面几个尤其典型。
1997 年,计算机击败国际象棋世界冠军卡斯帕罗夫,依靠的是大规模深度搜索(massive, deep search)。
当时,许多研究者一直在设法把人类对国际象棋结构的理解写进程序。看到深度搜索获胜,他们非常失望。
最终胜出的,是一个更简单的方案:大规模搜索,再配上专门的硬件和软件。
这些研究者并不服气。他们认为,“暴力”搜索也许赢了这一次,却算不上通用策略;况且,人类下棋也不是这么下的。
他们原本希望,依靠人类知识的方法能够取胜。结果恰恰相反。
计算机围棋重复了同样的故事,只是晚了大约 20 年。(译者注:这里的“约 20 年”,指从 1997 年 IBM“深蓝”击败卡斯帕罗夫,到 2016 年 AlphaGo 击败李世石,前后相隔约 19 年。)
早期,研究者投入大量精力,希望借助人类的围棋知识和棋局特征,尽可能减少搜索。
可一旦大规模搜索真正奏效,这些精心设计的知识不仅变得无关紧要,有时甚至会拖累系统。
围棋取得突破还有另一个关键:通过自我对弈来学习价值函数。学习在许多游戏中都很重要,国际象棋也不例外,只是它在 1997 年那套击败世界冠军的系统里还没有扮演主要角色。
自我对弈背后的“学习”,和大规模“搜索”一样,都能把海量算力转化为更强的能力。
搜索和学习,是 AI 领域利用大规模计算的两类核心方法。
无论国际象棋还是围棋,研究者起初都想用人类的理解来减少搜索。真正巨大的进步,却是在他们拥抱搜索和学习之后才出现的。
语音识别领域也经历过相同的转折。20 世纪 70 年代,DARPA 资助了一场早期竞赛。
一类参赛方法依赖大量人工知识,包括词语、音素和人类声道的知识。另一类方法以隐马尔可夫模型(HMM)为基础,更依赖统计,也使用了更多计算。
结果,统计方法再次战胜了依赖人工知识的方法。
这场胜利改变了整个自然语言处理领域。此后的几十年里,统计和计算逐渐成为主流。
近年来深度学习在语音识别中的崛起,只是这条路线的最新一步。它减少了对人工知识的依赖,使用更多算力,并从海量数据中学习,最终显著提升了语音识别的性能。
和棋类游戏一样,研究者总想按照自己理解的人类心智来设计系统,把这些理解直接写进机器。
但摩尔定律带来了越来越多的算力,人们也找到了利用这些算力的有效办法。
相比之下,把人类知识硬塞进系统,最终往往适得其反,也浪费了研究者大量时间。
计算机视觉也走过同样的弯路。
早期方法依赖人为设计的特征:寻找边缘、识别广义圆柱体,或者用 SIFT 描述图像。如今,这些方法大多已经退出主流。
现代深度学习网络只保留卷积和少量不变性假设,却取得了远好得多的效果。
这是一条分量很重的教训。但整个 AI 领域至今仍没有真正消化它,因为我们还在重复同样的错误。
要避免重蹈覆辙,首先要明白:为什么这些错误如此诱人?
苦涩之处在于:把我们对“思考方式”的理解预先写进系统,短期内可能有效,长期看却行不通。
AI 研究者试图把自己的知识预先写进智能体;
这样做短期内确实有帮助,也让研究者感觉良好;
但从长期看,这条路线会停滞,甚至阻碍进一步突破;
真正的突破最终来自相反的方向:扩大计算规模,让系统通过搜索和学习自行进步。
成功之所以苦涩,是因为最终获胜的,往往不是人们偏爱的、以人为中心的方法。
是要认真对待通用方法的力量。
即使今天的算力已经十分庞大,这类方法仍然能够随着算力增加而继续进步。
目前看来,最能以这种方式持续扩展、尚未显露明显上限的两种方法,就是搜索和学习。
心智真正要容纳的内容极其复杂,这种复杂性不可能被一套简单规则彻底概括。
我们不该再试图用几个简单概念,预先解释空间、物体、多智能体或对称性。
这些都属于外部世界,而外部世界本就千变万化、复杂无穷。
因此,我们不该把对这些事物的具体理解直接写进系统。真正应该内置的,是能够自行发现并捕捉复杂性的“元方法”。
这些方法当然需要找到有效的近似,但寻找近似的工作,应该交给方法本身,而不是由我们替它完成。
我们希望 AI Agents 能够像我们一样去发现,而不只是装进我们已经发现的答案。
如果我们只是把现成的发现写进系统,反而会遮蔽“发现”本身是如何发生的。
原文:https://www.cs.utexas.edu/~eunsol/courses/data/bitter_lesson.pdf







