← 返回播客与访谈档案

Rich Sutton:为什么 AI 模型停止学习,以及如何重启学习(Sequoia Capital,2026-08-18)

Sequoia Capital · 53 分钟 · 2026-08-18

强化学习奠基人、图灵奖得主 Rich Sutton 与 Oak Lab 联合创始人 Khurram Javed 做客红杉播客。这期值得听的原因是:Sutton 对当前 LLM 范式的批评是系统性的,且直接关联到 scaling 路线还能走多远这个投资问题。

一、核心批评:权重冻结即停止学习

Sutton 认为 LLM 的根本问题在于部署后权重永不更新:"创造 LLM 时所有的概念结构化生成都发生在权重学习里,你希望这个过程持续进行,我们却只让它发生一次。"他讽刺道:"他们声称能从一个完全不再学习的东西里做出博士级的专业能力——我不是怪人,你们才是怪人。"记忆功能和上下文学习在他看来只是改变模型状态,模型本身没有在学习。他明确表示与主流的分歧只有一点:预训练和后训练做多少都可以,"但当我在使用模型时,它停止了学习"。

他还有一个语言层面的观察:在 AI 狂热之前根本不需要"持续学习"这个词,因为谈论非持续的学习毫无意义——需要专门造出这个词,本身就是这个领域出了问题的证明。

二、合成数据是"一个大错误"

依据是 Alberta 学派流传多年、由 Javed 写成论文的"大世界假说":世界比任何智能体的心智都复杂得多,任何模拟都如同显微镜下的一粒。Javed 补充了操作层面的死结:谁来判定合成数据好坏?"如果 OpenAI、Anthropic 这些大实验室的工程师全去度假,谁来生成合成数据?"合成数据的瓶颈始终是人类专家,违背了去除人类瓶颈的初衷。正确做法是智能体从自身经验中学出自己的世界模型——模型错了可以自我修正,人写的模拟器只有等人发现错误才会更新。

三、LLM 与《The Bitter Lesson》的双重关系

Sutton 把 bitter lesson 概括为"别被人类知识分心,专注于能随算力扩展的学习方法"。LLM 前半程靠"喝下整个互联网"实现了巨大的算力扩展,属正面例证;但互联网是有限的,世界远大于互联网上存储的一切,最终 LLM 会成为"过度依赖人类知识终被其拖累"的又一例证。他同时强调 LLM 是"惊人的科学突破",但语言能力"大约只占智能的 20% 到四分之一",令他沮丧的是它"必须假装自己是全部的 AI"。

四、技术判断:灾难性遗忘可治,缺的是算法

Javed 指出在单一数据流上朴素更新权重会摧毁既有知识,这是算法缺口,与部署或隐私无关。Sutton 给出两个方向:一是逐权重的步长元学习(每个权重独立步长,新样本只更新该动的地方);二是"生成与测试"式注入新单元——他们发表在 Nature 的 continual backprop 算法在训练全程持续播撒随机初始化的新单元,因为普通反向传播的随机性只在初始时刻存在、之后被耗尽。但这些算法要求边学知识边元学习如何学习,必须从头训练新的基础模型,无法嫁接到现成模型上。

五、对行业的含义

Javed 认为大实验室被产品锁定在当前范式的局部最优上:现有范式还能继续 scaling,新范式则要求接受"先变差再变好"的过渡期,两者不兼容。他还断言效率上限远未触及:按摩尔定律 5-10 年后 20 瓦即可跑万亿参数模型;Sutton 挖苦说烧钱烧电成了实验室证明自己的方式。

Sutton 的具名判断:当持续学习实现时,"LLM 可能有风险(at risk)——它们已经有过很好的一段行情了"。Javed 举 Cursor 的 tab 补全模型为持续学习的现有雏形(靠海量用户数据批量更新策略),但称其效率很低——用户无法教自己的模型版本学专属的东西。两人的 Oak Lab 沿 2022 年"Alberta Plan"路线推进,目标是单一设计衍生出多个因经验不同而各异的心智。