EPISODE· generated 2026-06-09 14:44:14· 21 min
The Art of Scaling Reinforcement Learning Compute for LLMs | Bonnie Li
在本次访谈中,Google DeepMind 研究员 Bonnie 讨论了她团队关于扩展大规模语言模型(LLMs)强化学习(RL)计算的研究论文。该论文识别出 RL 训练中的 S 型缩放曲线,这与预训练中看到的对数线性损失减少不同。关键因素包括一个渐近上限,限制了奖励可以达到的高度,以及计算效率影响学习曲线的陡峭程度,突显了选择合适的算法配方对于最佳性能的重要性。
interviewcryptoaiweb3
ready · seed-vc · qwen3-tts
0:00/0:00
⚠ The Chinese audio is an AI-generated dub (speech synthesis / voice conversion), not a real recording and may contain errors. Based on the original English interview; all rights remain with the original creator.
original lang
EN
dubbed into
中文 (ZH)
pipeline
Plan C · voice conversion
voice model
seed-vc · qwen3-tts
001
大家好。呃,我的名字是Bonnie。嗯,我是Google Deep Mind的研究员,今天我很高兴能谈谈这篇关于为大型语言模型(LLMs)扩展强化学习(RL)计算能力的论文。
002
呃,我们知道,RL训练已经成为新的扩展前沿。呃,我们知道预训练教会模型如何理解世界,但RL真正解锁了最重要的能力。
003
最显著的。这包括测试时的推理、智能体能力以及诸如科学发现之类的内容。呃,预训练的扩展损失已经理解得相当清楚了。我们知道,
004
存在这样一个幂律,损失基本随着计算量呈对数线性下降。呃,但关于扩展RL训练呢?到目前为止,这还相当依赖直觉。嗯
005
有如此多的算法,许多设计选择,但目前还没有一个明确的扩展框架。呃,我们能不能引入同样的扩展框架?呃,在这篇论文中,他们发现了一个用于RL训练的扩展曲线。
006
呃,基本上,RL训练遵循这种类似S型的扩展曲线,其中x轴是计算量,y轴是你的RL设置的预期奖励。他们发现,
007
基本上可以在训练过程中拟合这个S型曲线,该曲线由渐近上限、计算效率和拐点所定义。呃,我们有渐近的
008
上限基本上决定了你的奖励能达到多高。所以这已经和预训练不同了。在预训练中,损失总是下降,但在 RL 中,你实际上受到
009
曲线能走多远的限制。此外,你还有计算效率,它决定了你的学习曲线有多陡。因此,这也意味着,如果你看一下这张图,如果你太早停止
010
训练,你的结果实际上可能会非常具有误导性,因为你可能会有一些曲线,一开始增长非常缓慢,但之后突然大幅上升。所以我们
011
看到 RL 训练与预训练非常不同。它遵循由 a 这个渐近上限和 b 计算效率所定义的 sigmoid 曲线。因此,通过不同的
012
方法,你会达到非常不同的上限。他们研究了不同的方法,比如扩展 RL QN、 DeepSeek,你看到的训练曲线差异非常大,这真的很有趣。因此,这告诉我们
013
这些算法选择从根本上限制了你能实现的东西,你不能仅仅通过延长训练时间来修复一个糟糕的方法。因此,拥有正确的方法非常重要。所以
014
我们如何构建最好的扩展 RL 方法? 这是论文中提出的完整扩展 RL 方法,我们稍后会逐一介绍每个组成部分。有很多
015
设计选择,而每个设计选择实际上都会影响扩展的不同方面。我们有诸如损失函数和训练推理差异之类的东西。这些实际上
016
限制了天花板,也就是你能够达到的高度,你的曲线能够上升到多高。嗯,这非常重要,因为你肯定希望你的曲线尽可能上升到最高。
017
还有像离线策略和归一化自适应采样这样的因素,通常会影响训练的效率。嗯,我想,是的,我会先讲离线策略,这在大规模 RL 中是一个相当大的问题。
018
为什么我们要使用离线策略 RL?嗯,这是因为在线策略 RL 非常低效。在线策略 RL 是什么意思?嗯,它非常
019
简单。你运行生成,生成大量样本。然后你得到你的 rollout,然后你运行一个训练步骤,然后用新的权重再运行一次生成
020
以获取样本,然后你再次运行训练。嗯,你看到在你运行生成的时候,这些样本中的一些
021
会非常长。所以,在很长一段时间内,你的 GPU 基本上只是空闲着。嗯,这是一个非常大的问题。你的 GPU 基本上在大部分时间里都是空闲的。
022
那么我们能做些什么来解决这个问题呢?一种方法是进行异步 RL。我们基本上将生成和训练重叠进行。我们进行生成,运行一个生成步骤,得到大量样本。我们用这些
023
样本进行训练,同时我们也在同时运行生成。我们始终同时运行生成和训练。我们重叠它们,我们
024
同时进行。 所以我们看到但问题是当你运行训练时 你训练所用的数据可能是由几步之前权重生成的。所以它不是
025
所以你的数据来自于一组不同的权重,而不是你正在训练的权重。这意味着异步 RL 是离线策略。所以数据生成策略,数据生成权重 是旧的
026
与 与训练策略相比,与你正在训练的权重相比。还有 管道 RL,它更进一步。 所以管道 RL 我们做这些
027
像飞行中的权重更新。所以当你生成一个轨迹时,对于智能体任务,这些轨迹可以变得非常长。 我们基本上说如果我们正在生成一个轨迹,并且中途
028
在轨迹过程中有一组新的权重就绪,我们只需中途换入一组新的权重,然后从那里继续轨迹,因此你可以有样本
029
由不同的权重集生成 这非常酷, 是的,我们可以看看管道 RL 与像离线离策略的比较,我们看到管道 RL 通常稍微
030
高效一些 但它们都收敛到大致相同的上限 管道 RL 中还有一个非常重要的参数,即你愿意训练的数据有多旧
031
所以 K 所以这里的八只是意味着 你仍然在训练 你可能正在训练由八步前权重生成的数据。
032
所以我们可以看到,像4和8这样的值通常是可以的,但一旦你到了像12这样的数值,差异就变得太大了,然后算法就开始停滞不前了,
033
不再起作用了。 所以这是你需要非常小心的一点。 好,这部分更多是关于基础设施方面,我们如何处理 off policy 在基础设施方面。 算法方面呢
034
在损失方面?嗯,那么我们如何处理离线策略在损失方面的问题呢?我们采用一种叫做重要性采样的方法。所以,我们现在先忽略这个术语。
035
所以这里的术语基本上是策略梯度。所以这就是 RL 的损失函数。嗯,但这里这个问题在于你有学习器和采样器,它们是不同的。嗯
036
你的采样器通常比学习器稍旧一些。所以在这里我们基本上添加了一个不同的项,或者我们添加了这个比例来纠正这种不匹配。 所以我们基本上添加了这个
037
这个术语基本上是学习者概率除以采样器概率,用于纠正这种分布不匹配。
038
呃,所以你可以对如何精确处理这个问题做很多数学运算。呃,有一个非常流行的 GRPO。所以他们处理这个比例的方式是,他们把这个比例进行裁剪。
039
所以理想情况下我们总是希望这个比例大约为一,因为理想情况下采样策略和训练策略应该非常接近。所以我们希望它在
040
理想情况下是1,但有时这个比例会变得非常不稳定。因此在GPO中,他们基本上将这个比例限制在1减去epsilon到1加上epsilon之间。然后
041
还有,这是来自字节跳动的一个非常流行的算法。他们意识到,使用GRPO时,策略的熵实际上会迅速崩溃。这是因为剪裁限制了信任区域,但它也限制了策略的探索程度。因此,他们提出了一个
042
叫做‘剪裁更高’的策略。字面意思就是剪裁得更高。当你进行剪裁时,在上限端你只需设置一个更高的epsilon。因此,你得到
043
一种不对称剪裁。此外还有GSPO,他们采用序列级别的重要性采样,而不是在词元级别上进行重要性采样,我们可以在整个
044
序列上进行重要性采样。然后还有syso,是的,有很多变体。之前我们是通过剪裁词元更新来实现的,这意味着我们基本上会丢弃那些
045
比例偏离太大的词元。在这里,他们提出我们其实不想丢弃词元,我们能不能直接剪裁?他们提出了一个技巧,直接剪裁重要性采样权重,以
046
稳定训练。我们可以看到不同的损失函数如何影响不同的渐近上限。因此在这个设置中,syso和gbo表现得相当不错。你看到曲线
047
比如 实际上运行得还不错。但在这个案例中,像 dappo 实际上很快就达到了平台期。所以对于不同的领域,你真的需要选对算法,否则
048
否则你就无法获得足够好的奖励。好的。现在我想进入一个在大规模 RL 中实际上最大的挑战之一,即 RL 中的训练与推理差异。所以这是
049
一个有点奇怪的问题。基本上,你的训练堆栈和推理堆栈是为完全不同的目标进行优化的。因此,这会导致很多固有的不匹配,仅仅是因为
050
不同的内核精度。在训练中,你可能会使用像 VLM 这样的精度,而在推理中,你可能使用的是 Megatron。所以这意味着,即使对于完全相同的权重,
051
你从训练堆栈和推理堆栈中得到的结果也可能非常不同。所以在这个图中,我们看到我们有完全相同的权重、完全相同的数据点,
052
我们从训练堆栈和推理堆栈中得到概率,它们应该是相同的。如果它们相同,它们应该围绕红线排列,但现实中我们看到它们实际上在
053
红线周围散开。有时候它们实际上彼此差异很大,尽管这仅仅是用完全相同的方式、完全相同的数据运行。所以这实际上在
054
RL 中是一个非常大的问题。所以有一篇中国的论文。在他们的情况下,他们原来的算法根本不起作用。所以如果你看那边的灰色曲线,
055
然后他们意识到哦,我们在不同层和不同组件之间存在相当大的训练与推理差异。所以他们深入研究并逐一解决了这些问题。首先他们修复了
056
KV 缓存中存在一些精度不匹配,只需修复这一点,你就能得到棕色曲线。所以只需修复这一点,算法就开始正常工作了,然后他们又修复了类似更多的问题
057
归一化注意力和rope,然后你就会看到,就像 一个一个地修复它们,算法就变得越来越好,最后你就能得到一个你得到红色的
058
曲线在 RL 训练中表现得相当稳定。所以在 RL 的论文中,他们也做了类似的事情。他们采用了一种方法,基本上是将这些矩阵乘法转换为 FP32 格式
059
训练和推理。所以你看到通过这个技巧之后,之前这个技巧之前我们有很多分散的值,但之后就更加集中在
060
数值更加集中和对齐,仅通过这个精度修复,你可以看到那边的曲线,他们获得了大约17%的相对上限提升。所以仅通过修复精度你
061
你可以在很大程度上影响你的训练表现。嗯,这也非常危险,因为如果你看那条橙色曲线,看起来好像没什么问题,但其实不清楚到底发生了什么
062
是错误的。嗯,这些差异并不是显而易见的错误。呃,它们只是默默地损害你的表现。呃,你真的想要尽量减少这种差异,以
063
稳定的 RL 训练。在 RL 训练中我们还做了什么?我们还做了自适应采样。有一种技巧叫做零方差过滤。它非常简单。它基本上说我们有很多问题。其中一些太难,一些又太容易。
064
如果太容易,模型总是得到一个奖励值为1,或者总是得到很高的奖励。如果太难,模型总是得到奖励值为0。所以我们只是
065
跳过这些样本。在训练过程中我们直接丢弃它们,只专注于那些模型有时能解决、有时不能解决的数据点。这真的
066
将训练计算资源集中在学习前沿。此外,无正样本重采样也非常简单。随着训练的进行,模型开始掌握一些问题。
067
其中一些问题虽然仍然通过零方差测试,但它们对学习的回报已经非常有限。因此在无正样本重采样中,我们
068
跟踪每个提示的历史通过率。如果模型能解决这个问题超过90%的时间,我们就丢弃它。这样我们可以逐步
069
专注于更难的问题。在训练过程中,这可能表现为从大约5,000个问题开始,模型学会解决其中的约200个问题,然后我们
070
只是丢弃那些。因此,我们逐渐拥有的训练问题越来越少,专注于那些真正具有挑战性的问题。因此,计算机从不会浪费在那些……该模型已经掌握。
071
而且通过自适应采样,我们看到这真的提高了计算效率,仅通过这两个非常简单的技巧。有时它们还会提高上限,这是 这还挺酷的。 所以 yeah 我们谈到了 scale RL 的配方。
072
所以我们讨论了不同的损失函数,比如 GPO dapple 和 sispo,以及训练和推理之间的差异。这两个因素真的会影响上限,以及就像上限能有多高 怎么样
073
high your performance can get。我们还讨论了离线策略和自适应采样,这些真的会影响你的效率,比如你的模型学习速度有多快
074
在这些问题上进行学习。所以这是一场信息密度很高的技术讨论。我们学到了什么?我们了解到,我们自己的训练遵循这种S型曲线的扩展模式。所以
075
这与幂律不同。我们了解到,不同的方法会有不同的性能上限,而且我们可以通过小规模训练运行来预测大规模性能。我们还
076
谈到了很多不同的权衡,比如 off policy 的 自适应采样和不同的 RL 算法。 它们也以不同的方式影响 扩展。有些影响效率,有些影响
077
的 的偷窃。 所以是的。所以是的,我希望你从你的下一次 RL 训练运行中获得一些见解。
078
你好。 这个配方的通用性如何?
079
,我认为它非常通用。我认为,是的,我认为这是一种非常系统的方式来思考 RL 扩展。所以,我认为它非常通用,而且很可能是一个
080
非常好的起点。我想象如果你有非常具体的问题,你可能会喜欢稍微调整一些东西,但通常来说,我认为它非常通用。
081
是的。我很好奇,为什么你认为形状是 sigmoid 形状?,这是我的第一个问题。第二个问题是,是否存在任何根本性的限制,限制它能达到多高
082
的上限?是的,这是一个好问题。,我认为因为 RL 是如此不同,好的,RL 与深度学习非常不同。在深度学习中,你是在一个固定的数据集上进行训练。,在 RL,
083
你的模型是在生成你用来训练的数据。所以,我认为一旦你的模型达到足够好的水平,突然就会获得很多非常有价值的学习点。所以,
084
它会迅速起飞。嗯,这就是我猜测为什么它的形状是S型的。嗯,是的。至于天花板,嗯,确实存在一些根本性的限制。嗯
085
我们在这里讨论的内容包括你使用的算法,以及训练和推理之间的差异,如果差异太大,就无法很好地工作。嗯,是的,我认为这些是算法的一些限制。
086
是的,在算法方面。
087
这和基础模型有多大关系呢?比如,哦,是的,如果基础模型非常差,天花板就会非常高。我认为基础模型的能力会影响两者。
088
所以,如果有一个强大的基础模型,可能可以非常快速地提升,但对于较差的基础模型,可能需要更长时间。我认为它会影响两者。
089
实际上,对我来说并不太清楚它对天花板的影响有多大,因为我认为一些小模型实际上非常有能力,只要你训练它足够长的时间。
090
训练足够长的时间。嗯,是的。
091
这是你们根据它来做的吗?呃,我想,呃,不是,不是,在这篇论文中没有那么强调,但我认为是的,你会看到像 Cursor 这样的东西,比如 composer 2.5,即使你没有最大的模型
092
比如,如果你在足够高质量的数据上训练足够长的时间,你就可以取得相当不错的进展,是的。 我认为在前面的问题中,其中一个原因是 RL 呃
093
奖励函数是有限的,对吧?所以最终你会遇到一个瓶颈,但如果你使用动态方法,它就是依赖的,这让我想到了我的问题。所以,
094
很高兴我们可以预测,所以我们可以从小规模开始,找到它会去往哪里,但我想知道在它的创新方面是否存在权衡,或者我们是否
095
知道它是否会逐渐被淘汰,我之所以问这个问题,是因为比如假设我们有1958年的原始神经网络论文,受限于计算能力,我确信他们很快就会遇到瓶颈
096
他们很快意识到,我们无法在这方面进一步改进,是的。 但比如,假设我们有100,000 GPU 小时,我们会遇到瓶颈,无法再进一步改进。
097
但我们实际上并不知道1000万小时是否能实现这一点。如果我们真的固定在基于配方的机器学习方法上,我想知道其中有多少是我们在放弃的
098
那些可能最终会成功的创新,比如自适应采样,这确实是一个非常棒的方法。比如说,当它达到某个任务的90%、95%准确率时
099
它可能会降低采样区域,这可能是一两个非常罕见的情况,可能会真正挽救生命,而我们可能没有进行采样因为我们会认为自己在那个特定任务上已经做得非常好,然后进行降采样。
100
所以我我想问,如果这个问题太长了,我很抱歉,但你如何看待可预测性好与创新空间之间的权衡
101
有多大。嗯,这是一个非常好的问题。我认为一般来说事情是相当可预测的,比如如果你看一下学习曲线,一旦你达到某个点
102
你就不会比这再进一步了。在创新方面,我认为这仍然是非常早期的工作,系统性地思考这些事情
103
这些方面的事情。所以,我觉得在⟶0⟶方面的一切都还非常早期。还有很大的扩展空间,我们甚至还没谈到扩展,比如扩展
104
环境数量、扩展领域数量,这些方面还有很多可以做的事情。所以我认为,人们确实应该在不同的动画上进行工作,比如
105
自适应采样,我觉得这是人们想出的一些非常简单的技巧,但我觉得人们应该继续在动画上进行工作 嗯,是的
106
嗯,超级达布装配,对于这些问题的基本类型,我们认为模型已经足够好,可以解决 但是,是否有可能在丢弃这些代码和代码容易
107
的问题之后,模型会逐渐倾向于更针对那些非常难的问题的技术或技能。是的。作为回报,会导致那些文化问题的回归,这存在一定的风险,比如这种困难。
108
是的。是的。这是一个非常好的问题。我认为,这还没有被很好地研究。实际上,我认为一些自适应采样的方法并不太有原则性,因为它
109
会以意想不到的方式改变你的训练分布。嗯,是的,我认为人们应该更深入地研究这一点,我认为它会以非常意想不到的方式改变行为,比如有时候
110
你的模型可能会因为过度训练某些特定类型的问题而表现出非常奇怪的行为。所以是的,我认为
111
人们应该非常小心这一点。嗯,是的,我知道大多数都是基于结果的奖励。我们有没有研究过基于过程的奖励的上限,或者我们对此有任何扩展研究吗?
112
嗯,是的,我认为在很多领域,人们使用奖励模型或评分标准。我认为这些扩展规律在大多数情况下仍然成立嗯,可能有一些奖励黑客行为,但总体上仍然成立。
113
在基于过程的奖励方面。我不太确定。我确实, 有很多奖励塑造的案例。所以他们做了很多奖励塑造。在大多数情况下,这只是一个二进制重新排序。嗯,你认为三重性有类似的上限代码吗?
114
是的,我觉得我见过非常简化的 奖励设置,其中你确实会得到像每一步的不同部分奖励,并对它们进行求和。,所以我认为在这些
115
情况下,它仍然成立,但如果你进入像更细致的流程情况,比如非常奖励某些流程中的特定部分是的。我不太确定。我不太确定那里的情况。是的。我认为那可能看起来会有所不同。是的。在那边。
116
是的。这真的很有趣。它让我从产品角度思考得更多。我在想,是否应该开始对那些我们推送出去并交付的模型进行标记,基于
117
这个预测性指标,对吧?比如,是否应该用这个标签作为标记,表示我们认为模型所处的位置及其潜力,或者没有
118
是的,我认为这会非常有用。实际上,是的,评估模型的潜力真的很困难,即使是开源的中文模型,比如你仅仅通过微调它,就可能得到非常令人惊讶的结果。
119
所以我认为,是的,我认为这肯定非常有趣。
120
反过来想,我觉得这可能有用,但这也像是一个内部基础漏洞,我只是一个产品拾取者,或者你觉得这会对开放领域有用吗?
121
我认为这肯定对开放科学有用。我觉得这会非常有趣。嗯,我不确定在这一点上经济激励如何对齐。不过,我觉得这确实是非常有趣的研究。
122
很酷。好的。谢谢,Bobby。非常感谢。
end of transcript · 122 segments