← 返回播客与访谈档案

强化学习只泛化出任务时长,持续学习卡在灾难性遗忘,研究员十倍提速的时间表分歧在两年与五到十年(Dwarkesh Podcast,2026-09-11)

Dwarkesh Podcast · 97 分钟 · 2026-09-11

本期是主持人 Dwarkesh Patel 召集的研究者圆桌,时长 97 分钟。三位嘉宾分别是 Thinking Machines 首席科学家、OpenAI 联合创始人 John Schulman(曾主导催生 ChatGPT 的 RLHF,即基于人类反馈的强化学习),开源模型公司 Zyphra 首席技术官 Beren Millidge,以及 Baseten 模型训练负责人 Charlie O'Neill。开场问题是:若到 2036 年世界仍未被超级智能改写,技术上的首要原因会是什么。口径提示:观点均为嘉宾个人判断,实验数字与模型规模猜测均为口播;自动字幕没有说话人标记,归属按点名、互相引用和观点前后一致性判断,存在误差,判断不了的写作“一位嘉宾”。三人给出的时间表从一年跨到十年,对未来几年约束项的判断却多有重合,都落在算力、环境构建与目标设定上;据此,递归自我改进快慢之争无论偏向哪一边,算力都仍是约束项,两边的差别在于算力流向更多实验与推演,还是流向构造成本逐级抬升的环境阶梯(作者归纳)。

强化学习泛化出了任务时长,跨领域迁移仍靠逐域铺环境

三位嘉宾都承认强化学习(reinforcement learning,RL)存在泛化,分歧集中在泛化的方向与幅度。Charlie O'Neill 的拆法是:业内原先期待推理能力横向泛化到各个领域,这一点没有兑现,只练数学未必成为出色的程序员,代码环境仍要单独做;兑现的是时长泛化,模型学会用更多 token、在更长时间里持续推进任务。他引用 EdgeBench 论文称模型可持续工作的时长每三个月翻一番,并把单项金融或 Excel 任务上通过率从 0.5% 跳到 90% 比作预训练里的“量子”式相变。

Beren Millidge 更乐观,认为强化学习的泛化在实践中已能看到,数学、代码与谜题之间确有迁移,环境覆盖面也比两年前宽得多。John Schulman 更谨慎:整个领域高度依赖泛化,何时出现分布外泛化很难预测,从可验证任务迁移到难验证任务“先验上没有理由期待”。

主持人追问:实验室押注在数百万个环境上扩大可验证奖励强化学习(RLVR)来获得通用能力,为何还要把 PowerPoint 这类技能逐项练进模型。John 的回答是,即便模型能在上下文里现学,把直觉写进权重也能提高运行时效率,模型参数足够大,两头兼顾代价不高。

John 还用难度与真实度两条轴解释蒸馏为何追不平前沿:难而易验证的刷榜分布(benchmaxxing)容易批量制造,真实编码代理场景的多轮往返与多重目标需要评分细则或人类反馈;只在刷榜分布上蒸馏,学生模型能追平基准分数,在真实分布上表现更差。一位嘉宾认为蒸馏是对抗供应商集中化的主要力量,强化学习学到的行为只含少量信息比特,拿到轨迹就容易复制。

若横向泛化持续偏弱,能力扩张就要按领域补环境,节目中描述的 Anthropic 环境谱系(编码、金融 Excel、PowerPoint 依次推进)就是这条路径,环境与算力投入随覆盖领域数增加;若蒸馏持续有效,单家实验室在环境上的领先更易被复制,其资本开支的独占回报会被摊薄(作者归纳)。

持续学习卡在小批量迭代时的灾难性遗忘,John Schulman 提醒短板不止样本效率

主持人的出发点是:推理占用约一半算力,却不直接让模型变好;样本效率上,模型相对人类“可能落后百万倍”。他默认十年内会出现递归自我改进(recursive self-improvement,RSI),主要疑虑就在这里。开场描述停滞情形的嘉宾(按上下文判断为 Beren)给出的条件也是元学习泛化困难叠加持续学习(continual learning)无解,外加消除不了的仿真到现实(sim-to-real)差距。

Charlie 给出的实验证据区分了两个尺度。在批量足够大、噪声被平均掉的尺度上,把部署数据放进中期训练(mid-training)并自建环境的外环已经有效;放大到单个模型,比如针对一家律所用少量数据连续做数百次微更新,就会出现灾难性遗忘(catastrophic forgetting)与通用能力退化,在策略蒸馏(on-policy distillation)只能推迟。他的解释是监督微调破坏性太强,强化学习对模型改动很小,也因此难以装进“某律所某流程”这类显性知识。

另一位嘉宾判断问题主要出在方法上,容量是够的:同尺寸模型纳入全部数据从头预训练效果更好,在同一基座上持续中期训练终会走平,所以业界不断训练新基座;被问到是否因此卡在从头重训,回答是“这当然非常昂贵”。

John 认为样本效率只是短板之一,另有思维多样性低、长期判断差等短板;他把品味的一部分定义为知道什么在长期有效,例如哪些软件系统长期可维护。他也质疑仿真到现实能否一直是主导框架,因为与大量真人实时互动的场景难以仿真。

一位嘉宾把任务分成可累积与非平稳两类:RSI 可累积,注意力、混合专家、GRPO 一经发现就留在训练栈里;律所助理面对人际关系与隐性流程不断变化的非平稳分布。若实验室相信 RSI 可累积,更多算力会集中投向它。

若持续学习长期无解,基座模型需要周期性从头重训,预训练算力按代际延续;若小批量更新不再遗忘,嘉宾设想的“永远不再训练新模型”会把训练算力从阶段性大投入摊平为持续更新,训练侧需求的节奏与形态都会改变(作者归纳)。

代码产出放大不等于研发提速,瓶颈落在判断、选题与定义目标

嘉宾把研发提速的上限归到写代码以外的环节。一位嘉宾描述了反复出现的循环:新模型发布,人们惊呼这就是 AGI,用上一个月又觉得它笨;做研究与工程时仍被模型判断较差、无法充分自检的环节卡住,“即使模型写的代码远多于人,也不会让你效率提高 100 倍”。

另一位嘉宾给出目标明确时的提速空间:若当年有 AI 审视 Kaplan 缩放定律(scaling laws),会发现中间检查点没有计入学习率退火,能省下一两年进展;在优化现有目标的范围内,他设想约 10 倍提速,但思考只能更新后验、得不到新的信息比特,也换不来正确的目标。

John 认为研究离天花板很远,未来 AI 花在分析与理论构建上的算力可与实验本身相当。他判断留给人类时间长的工作是定义目标,包括决定助手如何行为、撰写宪法与模型规范,后训练团队需要很多人,是因为每个领域都要有人想清楚模型该怎样表现。另一位嘉宾补充,目前 AI 决定做什么实验的能力远弱于写实验代码,提议多是很小的步子。

快问环节里,对“AI 研究员十倍提速”,嘉宾给出两年与五到十年两个答案。Beren 以编码环节“肯定已经超过十倍”为由认同两年,认为模型能连续跑一两轮实验反馈就很可观;给出更长时间的一方把约束归为“我吸收信息并对下一个实验做贝叶斯最优决策的能力”。

若瓶颈在选题与目标设定,代码代理释放的产能会转化为更多实验与分析,John 设想的分析算力与实验算力相当,意味着每轮研究的算力开销上移;若两年十倍兑现,约束会转移到算力与实验排队上(作者归纳)。

百万副本能否转为快速起飞,取决于 AI 自行提出目标的闭环能否长期不出轨

一位嘉宾复述了起飞论:AI 研究员只要比所有人强 0.1%,就能并行运行数十万乃至上百万个副本,芯片提速后跑得更快,足以压倒其他瓶颈。

Beren 把核心问题放在 AI 能否泛化到学习自己的目标:闭环要求提出目标、优化、再提出新目标,并在很长时间里不出轨。他提出莫拉维克悖论式的可能,即人类觉得理所当然的自主性对 AI 反而难,但也承认如今智能体“非常执着”,这本身是反证。

John 对首批自动化 AI 研究员如何训练的判断偏工程化:用人类反馈吸收研究员的品味,加上大量多步研究项目练习环境,每一代修补上一代的明显缺陷。一位嘉宾补充,算力紧张会让实验室停在谱系前沿,把近几个月发现的训练栈漏洞变成环境,相当于把近三个月的研究进展蒸馏回模型,“这也许就是我们有人觉得它是渐近的原因”;另一位嘉宾提出,环境可以设得远超人类,这是越过轨迹蒸馏上限的途径。

若自提目标的闭环不能长期稳定,百万副本主要放大现有目标下的优化,对应上文约 10 倍的量级;若闭环成立,副本数量与芯片速度会直接折算为研发速度,算力需求对能力进展的弹性会放大(作者归纳)。

渐近线之争:环境阶梯可以攀爬,每一级的构造成本在上升

一位嘉宾担心撞上渐近线:摩尔定律的直线背后是许多离散突破,大模型也在预训练收益递减后靠强化学习接续;若还需要一次不连续突破,靠强化学习环境训练出的模型未必能发现它。John 回忆早年在 OpenAI 时直觉只降低对数损失得不到智能,“结果它就是奏效了”。

一位嘉宾承认存在一组环境阶梯,能得到至少与人类研究员相当的 AI,但爬每一级的投入“大致指数式增长”,现有环境利用的倒推比正推容易等不对称用完后,曲线会走平。他举例,把只会五年级数学的模型直接用强化学习训大学数学爬不上去,逐年级训练才行;强化学习不擅长探索,“128 次推演里拿不到,就很难得到信号”。Beren 顺着区分信号来源:预训练的信号已在 Common Crawl 里,难点是过滤噪声;中后期训练所需的信号原始数据里没有,“Common Crawl 里没有藏着千禧年难题的证明”,只能从人、环境或部署中取得。主持人给出反例:只用 1930 年前数据训练的 Talkie 模型,经编码代理数据微调后在 SWE-bench 上超过 Claude 3 Opus。

节目中一位参与者介绍的小规模网格实验显示,2019 年以来数据约带来 12.0 倍算力效率提升,架构约 3.7 倍,与 Epoch 估算的每年约 3 倍之间的缺口被归于规模依赖与后训练。

若每级环境的构造成本指数上升,单位能力增量对应的环境与算力投入会抬升,投入规模可以维持,边际回报随之下降;若 Talkie 式“有示范即可复制”普遍成立,追赶方的成本会低于开拓方(作者归纳)。

算力配比:未来几年受算力约束,推理效率压低活跃参数,总参数跟着硬件内存走

嘉宾都把未来几年的约束项放在算力上,分歧在模型会否继续变大。Charlie 认为强化学习推演(rollout)越来越长,推理效率很关键,瓶颈仍在环境,参数规模可能进入平台期;他感觉 Mythos 与 GPT 系列“比外界传的 10 万亿参数小得多”,模型大小应由预训练数据量和难度顶端环境上的单次通过率决定,“很大程度取决于 Mercor 与内部团队扩展环境复杂度的速度”。一位嘉宾补充,业界在 1000 亿至 2 万亿参数区间徘徊已有一段时间。

另一位嘉宾(按上下文判断为 John)预计模型会随算力扩张与 GPU 变大继续变大,高质量预训练数据趋紧后数据效率对架构选择的影响会超过算力效率。Beren 认为推理效率会把活跃参数压得很低,总参数取决于内存带宽与显存,行业从 H100 迁到 GB 系列再到 Vera Rubin 后,才更有能力服务多万亿参数模型、做更大规模的强化学习推理;眼下数据充足、算力是约束,所以模型偏小。有嘉宾把问题归结为训练与推理算力的配比:卡数据就做大,卡算力就做小。

若活跃参数被推理效率压低、总参数随显存与内存带宽扩张,强化学习推演规模会与高内存带宽机架系统的换代节奏绑定,推理侧算力需求增长更快;若数据先于算力成为约束,模型重新变大,训练侧单次投入会回升(作者归纳)。

时间表:远程员工约一到三年,全面超越顶尖专家三到十年

对能胜任一个月白领工作的远程员工,Charlie 给出约一年(强制走浏览器则两年左右),Beren 给出完全通用约三年、此前可完成八到九成,John 同意二人“一年左右会有还行的版本”。对在所有计算机可完成的认知工作上超越顶尖专家,答案有三到四年与五到十年,给出五到十年的一方认为自动化 AI 研究几乎等同实现超级智能。时间表偏长的一方更强调持续学习与长时程学习(作者归纳)。

验证点(作者归纳)

若 EdgeBench 一类可持续工作时长度量的翻倍周期拉长到三个月以上,则 Charlie O'Neill 的时长泛化论点被削弱;若模型在未做专门环境训练的新领域取得接近专训领域的表现,则“逐域铺环境”一方被削弱。

若前沿实验室的模型更新节奏从季度级缩短到周级,且没有通用能力退化的报告,则“持续学习卡在灾难性遗忘”一方被削弱。

若到 2028 年 9 月前后,前沿实验室的下一轮实验仍普遍由人决定、模型只能连续执行一两轮实验反馈,则“两年十倍提速”一方被削弱;若届时主要实验室公开称研究产出提速达到十倍量级,则“五到十年”一方被削弱。

若在 GB 系列与 Vera Rubin 普及后,开源前沿模型总参数仍停留在 1000 亿至 2 万亿区间,则“模型随算力继续变大”的判断被削弱;若突破该区间,则 Charlie 的参数平台期判断被削弱。