跳转至

苦涩的教训(The Bitter Lesson)

原文:The Bitter Lesson
作者:Rich Sutton · 发布时间:2019-03-13

译文版本:v0.1

译文说明

本文为强化学习先驱 Rich Sutton 2019 年发表的著名短文《The Bitter Lesson》的中文翻译。文章回顾了 AI 七十年研究中最深刻的教训:利用大规模算力(computation)的通用方法(general method),最终总是胜过精心设计的人类知识系统。全文涵盖计算机象棋、围棋、语音识别、计算机视觉四个领域的案例,并从中提炼出两条核心启示。术语遵循项目统一术语表,链接保留原文地址。


从 70 年的 AI 研究中可以读出的最大教训是:利用算力的通用方法(general method)最终是最有效的,且领先幅度巨大。其根本原因是摩尔定律(Moore's law)——或者更准确地说,是其推广形式:单位算力成本持续呈指数级下降。绝大多数 AI 研究的开展方式,都仿佛智能体可用的算力是固定不变的(在这种情况下,利用人类知识确实是提升性能的唯一途径之一);然而,只需将时间尺度拉长到超过一个典型研究项目的时长,远超当下的海量算力就必然会变得可用。研究者为了寻求能在短期内产生影响的改进,自然会诉诸他们对领域的人类知识;但从长远来看,唯一重要的是对算力的利用。这两者本不必互相冲突,但在实践中它们往往如此——花在一者上的时间,就是没花在另一者上的时间。对某一范式投入了心力,人自然会形成心理上的认同与坚持。而人类知识的路径倾向于使方法变得更复杂,从而使其更不适合利用那些凭借算力扩展的通用方法。AI 研究者们在这个过程中迟来地领悟到这条苦涩的教训,有不少案例,回顾其中最突出的一些,对我们会很有启发。

在计算机象棋领域,1997 年击败世界冠军卡斯帕罗夫的方法,正是建立在大规模、深度的搜索之上。当时,大多数计算机象棋研究者对此感到沮丧——他们长期追求的是利用人类对国际象棋独特结构的理解。当一个结合了专用硬件与软件的、更简单的、基于搜索的方法被证明远为有效时,这些以人类知识为基础的象棋研究者们并不是好输家。他们说,"暴力搜索(brute force search)"这次可能赢了,但它不是一种通用策略,而且无论如何,那也不是人类下棋的方式。这些研究者希望基于人类输入的方案获胜,当它未能如愿时,便感到失望。

类似的研究进展模式也出现在计算机围棋领域,只是又推迟了 20 年。早期的大量努力都放在了借助人类知识或围棋的特殊属性来规避搜索上,然而一旦搜索被有效地大规模应用,所有这些努力便被证明是无关紧要的——甚至更糟。同样重要的是利用自我对弈(self play)来学习价值函数(value function)(这在许多其他游戏中也是如此,甚至在象棋中也不例外,尽管在 1997 年首次击败世界冠军的程序中,学习并未发挥重要作用)。自我对弈学习——以及更一般意义上的学习——与搜索类似,它使得海量算力的介入成为可能。搜索与学习,是 AI 研究中利用庞大算力的两类最重要的技术。在计算机围棋中,如同在计算机象棋中一样,研究者最初的努力都指向了利用人类理解(从而减少对搜索的需求),直到很久之后,拥抱搜索与学习才带来了远为巨大的成功。

在语音识别领域,早在 1970 年代,DARPA 就赞助了一场早期竞赛。参赛者中有一派使用了大量利用人类知识的特殊方法——词汇知识、音素知识、人类声道知识,等等。另一派则是更新颖的方法,它们本质上更加统计化,需要多得多的计算,其基础是隐马尔可夫模型(Hidden Markov Model,HMM)。再一次,统计方法战胜了基于人类知识的方法。这导致了整个自然语言处理领域的重大转变——在随后几十年里逐渐发生,统计与计算最终主导了这一领域。近期深度学习在语音识别中的崛起,正是沿着这一贯穿始终的方向迈出的最新一步。深度学习方法对人类知识的依赖更少,使用的算力更多,结合在大规模训练集上的学习,最终产生了性能飞跃的语音识别系统。正如在棋类游戏中一样,研究者总是试图让系统按照他们认为自己大脑工作的方式来运行——他们试图把那些知识塞进系统里——但最终被证明适得其反,并且是研究者时间的巨大浪费,因为,借助摩尔定律,海量算力终究变得可用,并且人们也找到了善加利用它的手段。

在计算机视觉领域,也存在类似的模式。早期方法将视觉构想为对边缘、广义圆柱体或 SIFT 特征的搜索。但如今,这一切都已被抛弃。现代的深度神经网络仅使用卷积的概念和特定类型的不变性,性能却好得多。

这是一个重大的教训。作为一个领域,我们仍未彻底吸取它,因为我们还在继续犯同样类型的错误。要想看清这一点,并有效地抵制它,我们必须理解这些错误为何具有诱惑力。我们必须学会这条苦涩的教训:那种把我们自以为的思维方式构建进系统的做法,长远来看是行不通的。这条苦涩的教训建立在如下历史观察之上:1)AI 研究者常常试图将知识构建到他们的智能体中;2)这在短期内总是有效,且令研究者个人感到满足;但 3)从长远来看,它会进入平台期,甚至抑制进一步进展;以及 4)突破性的进展最终来自相反的方向——基于搜索与学习来扩展算力。最终的成功带有一丝苦涩,且往往未能被完全消化,因为这是一种超越了自己所青睐的、以人为中心的方法的成功。

从这条苦涩的教训中,我们应当学到的一件事是通用方法的巨大威力——那些即使可用算力变得极其庞大,仍能随算力增长而持续扩展的方法。能以这种方式近乎无限扩展的两类方法,就是搜索与学习。

从这条苦涩的教训中应当学到的第二个普遍观点是:心智的实际内容极其复杂,且这种复杂性无从化简;我们应当停止尝试用简单的方式来思考心智的内容——比如用简单的方式来思考空间、物体、多智能体或对称性。所有这些都是任意的、内在复杂的外部世界的一部分。它们不是应当被内置进系统的内容,因为它们的复杂性无穷无尽;相反,我们应当只构建那些能够发现并捕获这种任意复杂性的元方法(meta-method)。这些方法的关键在于,它们能找到良好的近似,但对这些近似的搜索应当由我们的方法来执行,而非由我们亲自来完成。我们想要的 AI 智能体,是能够像我们一样去发现的智能体,而不是那些只包含了我们已有发现的智能体。将我们的发现内置于系统,只会让我们更难看清发现过程本身是如何完成的。