Token导航 LogoToken导航

Richard Sutton 苦涩的教训与 Scaling Law

更新时间 2026-10-01来源 十字路口Crossing正文 2624字阅读约 9分钟1 张图片
今天 AI 行业为什么如此相信 Scaling Law?
图片

👦🏻 作者: Richard Sutton

🥷 编译: NCon

「十字路口」编者按(Koji)

国庆假期,我们翻出几篇经典文章,推荐给大家。

想理解今天 AI 行业为什么如此相信 Scaling Law,我觉得《苦涩的教训》是一篇绕不开的文章。从大模型到具身智能,从业者在讨论技术路线时,反复提起这篇写于 2019 年的短文。

Richard Sutton 回顾了几十年的 AI 研究,指出一个让研究者不太舒服的规律:人类精心设计的领域知识,往往会在长期竞争中,输给能够持续利用更多计算的通用方法。

这也是今天许多人相信 Scaling 的重要思想来源之一:把时间尺度拉长,真正重要的不是一种方法眼下有多精巧,而是它能否随着算力增长持续进步。

所以,国庆期间我想推荐大家读一遍原文。它能帮助我们理解,今天许多 AI 从业者对未来的信心从何而来,以及这种信念如何影响他们选择问题、设计系统和投入研究。
拉长时间尺度

回顾过去 70 年的 AI 研究,最重要的教训是:从长期看,最有效的,往往是那些能够不断利用更多算力的通用方法。

原因在于摩尔定律。说得更准确一些,是因为计算越来越便宜,单位算力的成本长期呈指数下降。

AI 研究项目启动时,研究者常常默认可用算力不会发生太大变化。在这个前提下,把人类掌握的知识写进系统,似乎是少数能够提升性能的办法之一。

但只要把时间尺度拉长一些——哪怕只比一个典型研究项目多几年——可用算力就会大幅增长。

为了在短期内做出成果,研究者自然会诉诸自己熟悉的领域知识。但从长期看,真正决定成败的,是一种方法能否持续利用越来越多的算力。

理论上,领域知识和计算并不冲突;现实中,它们却常常争夺同样的时间和精力。把时间花在一条路线上,就无法同时投入另一条路线。

而一旦在某条路线上投入太多,研究者也容易在心理上对它产生依恋。

更麻烦的是,把大量人类知识写进系统,往往会让系统越来越复杂,反而难以受益于那些能够利用算力的通用方法。

比比皆是的例子

AI 研究史上,这样的例子比比皆是。

下面几个尤其典型。

1997 年,计算机击败国际象棋世界冠军卡斯帕罗夫,依靠的是大规模深度搜索(massive, deep search)。

当时,许多研究者一直在设法把人类对国际象棋结构的理解写进程序。看到深度搜索获胜,他们非常失望。

最终胜出的,是一个更简单的方案:大规模搜索,再配上专门的硬件和软件。

这些研究者并不服气。他们认为,“暴力”搜索也许赢了这一次,却算不上通用策略;况且,人类下棋也不是这么下的。

他们原本希望,依靠人类知识的方法能够取胜。结果恰恰相反。

计算机围棋重复了同样的故事,只是晚了大约 20 年。(译者注:这里的“约 20 年”,指从 1997 年 IBM“深蓝”击败卡斯帕罗夫,到 2016 年 AlphaGo 击败李世石,前后相隔约 19 年。)

早期,研究者投入大量精力,希望借助人类的围棋知识和棋局特征,尽可能减少搜索。

可一旦大规模搜索真正奏效,这些精心设计的知识不仅变得无关紧要,有时甚至会拖累系统。

围棋取得突破还有另一个关键:通过自我对弈来学习价值函数。学习在许多游戏中都很重要,国际象棋也不例外,只是它在 1997 年那套击败世界冠军的系统里还没有扮演主要角色。

自我对弈背后的“学习”,和大规模“搜索”一样,都能把海量算力转化为更强的能力。

搜索和学习,是 AI 领域利用大规模计算的两类核心方法。

无论国际象棋还是围棋,研究者起初都想用人类的理解来减少搜索。真正巨大的进步,却是在他们拥抱搜索和学习之后才出现的。

语音识别领域也经历过相同的转折。20 世纪 70 年代,DARPA 资助了一场早期竞赛。

一类参赛方法依赖大量人工知识,包括词语、音素和人类声道的知识。另一类方法以隐马尔可夫模型(HMM)为基础,更依赖统计,也使用了更多计算。

结果,统计方法再次战胜了依赖人工知识的方法。

胜利带来的改变

这场胜利改变了整个自然语言处理领域。此后的几十年里,统计和计算逐渐成为主流。

近年来深度学习在语音识别中的崛起,只是这条路线的最新一步。它减少了对人工知识的依赖,使用更多算力,并从海量数据中学习,最终显著提升了语音识别的性能。

和棋类游戏一样,研究者总想按照自己理解的人类心智来设计系统,把这些理解直接写进机器。

但摩尔定律带来了越来越多的算力,人们也找到了利用这些算力的有效办法。

相比之下,把人类知识硬塞进系统,最终往往适得其反,也浪费了研究者大量时间。

计算机视觉也走过同样的弯路。

早期方法依赖人为设计的特征:寻找边缘、识别广义圆柱体,或者用 SIFT 描述图像。如今,这些方法大多已经退出主流。

现代深度学习网络只保留卷积和少量不变性假设,却取得了远好得多的效果。

这是一条分量很重的教训。但整个 AI 领域至今仍没有真正消化它,因为我们还在重复同样的错误。

要避免重蹈覆辙,首先要明白:为什么这些错误如此诱人?

苦涩之处在于:把我们对“思考方式”的理解预先写进系统,短期内可能有效,长期看却行不通。

历史一再呈现出同样的过程:

AI 研究者试图把自己的知识预先写进智能体;

这样做短期内确实有帮助,也让研究者感觉良好;

但从长期看,这条路线会停滞,甚至阻碍进一步突破;

真正的突破最终来自相反的方向:扩大计算规模,让系统通过搜索和学习自行进步。

成功之所以苦涩,是因为最终获胜的,往往不是人们偏爱的、以人为中心的方法。
第一条教训

是要认真对待通用方法的力量。

即使今天的算力已经十分庞大,这类方法仍然能够随着算力增加而继续进步。

目前看来,最能以这种方式持续扩展、尚未显露明显上限的两种方法,就是搜索和学习。

第二条更普遍的教训

心智真正要容纳的内容极其复杂,这种复杂性不可能被一套简单规则彻底概括。

我们不该再试图用几个简单概念,预先解释空间、物体、多智能体或对称性。

这些都属于外部世界,而外部世界本就千变万化、复杂无穷。

因此,我们不该把对这些事物的具体理解直接写进系统。真正应该内置的,是能够自行发现并捕捉复杂性的“元方法”。

这些方法当然需要找到有效的近似,但寻找近似的工作,应该交给方法本身,而不是由我们替它完成。

我们希望 AI Agents 能够像我们一样去发现,而不只是装进我们已经发现的答案。

如果我们只是把现成的发现写进系统,反而会遮蔽“发现”本身是如何发生的。

本文作者:Richard Sutton

原文:https://www.cs.utexas.edu/~eunsol/courses/data/bitter_lesson.pdf
文章标签智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多