[ { "i": 0, "speaker": "Speaker 1", "text": "大家好。呃,我的名字是Bonnie。嗯,我是Google Deep Mind的研究员,今天我很高兴能谈谈这篇关于为大型语言模型(LLMs)扩展强化学习(RL)计算能力的论文。" }, { "i": 1, "speaker": "Speaker 1", "text": "呃,我们知道,RL训练已经成为新的扩展前沿。呃,我们知道预训练教会模型如何理解世界,但RL真正解锁了最重要的能力。" }, { "i": 2, "speaker": "Speaker 1", "text": "最显著的。这包括测试时的推理、智能体能力以及诸如科学发现之类的内容。呃,预训练的扩展损失已经理解得相当清楚了。我们知道," }, { "i": 3, "speaker": "Speaker 1", "text": "存在这样一个幂律,损失基本随着计算量呈对数线性下降。呃,但关于扩展RL训练呢?到目前为止,这还相当依赖直觉。嗯" }, { "i": 4, "speaker": "Speaker 1", "text": "有如此多的算法,许多设计选择,但目前还没有一个明确的扩展框架。呃,我们能不能引入同样的扩展框架?呃,在这篇论文中,他们发现了一个用于RL训练的扩展曲线。" }, { "i": 5, "speaker": "Speaker 1", "text": "呃,基本上,RL训练遵循这种类似S型的扩展曲线,其中x轴是计算量,y轴是你的RL设置的预期奖励。他们发现," }, { "i": 6, "speaker": "Speaker 1", "text": "基本上可以在训练过程中拟合这个S型曲线,该曲线由渐近上限、计算效率和拐点所定义。呃,我们有渐近的" }, { "i": 7, "speaker": "Speaker 1", "text": "上限基本上决定了你的奖励能达到多高。所以这已经和预训练不同了。在预训练中,损失总是下降,但在 RL 中,你实际上受到" }, { "i": 8, "speaker": "Speaker 1", "text": "曲线能走多远的限制。此外,你还有计算效率,它决定了你的学习曲线有多陡。因此,这也意味着,如果你看一下这张图,如果你太早停止" }, { "i": 9, "speaker": "Speaker 1", "text": "训练,你的结果实际上可能会非常具有误导性,因为你可能会有一些曲线,一开始增长非常缓慢,但之后突然大幅上升。所以我们" }, { "i": 10, "speaker": "Speaker 1", "text": "看到 RL 训练与预训练非常不同。它遵循由 a 这个渐近上限和 b 计算效率所定义的 sigmoid 曲线。因此,通过不同的" }, { "i": 11, "speaker": "Speaker 1", "text": "方法,你会达到非常不同的上限。他们研究了不同的方法,比如扩展 RL QN、 DeepSeek,你看到的训练曲线差异非常大,这真的很有趣。因此,这告诉我们" }, { "i": 12, "speaker": "Speaker 1", "text": "这些算法选择从根本上限制了你能实现的东西,你不能仅仅通过延长训练时间来修复一个糟糕的方法。因此,拥有正确的方法非常重要。所以" }, { "i": 13, "speaker": "Speaker 1", "text": "我们如何构建最好的扩展 RL 方法? 这是论文中提出的完整扩展 RL 方法,我们稍后会逐一介绍每个组成部分。有很多" }, { "i": 14, "speaker": "Speaker 1", "text": "设计选择,而每个设计选择实际上都会影响扩展的不同方面。我们有诸如损失函数和训练推理差异之类的东西。这些实际上" }, { "i": 15, "speaker": "Speaker 1", "text": "限制了天花板,也就是你能够达到的高度,你的曲线能够上升到多高。嗯,这非常重要,因为你肯定希望你的曲线尽可能上升到最高。" }, { "i": 16, "speaker": "Speaker 1", "text": "还有像离线策略和归一化自适应采样这样的因素,通常会影响训练的效率。嗯,我想,是的,我会先讲离线策略,这在大规模 RL 中是一个相当大的问题。" }, { "i": 17, "speaker": "Speaker 1", "text": "为什么我们要使用离线策略 RL?嗯,这是因为在线策略 RL 非常低效。在线策略 RL 是什么意思?嗯,它非常" }, { "i": 18, "speaker": "Speaker 1", "text": "简单。你运行生成,生成大量样本。然后你得到你的 rollout,然后你运行一个训练步骤,然后用新的权重再运行一次生成" }, { "i": 19, "speaker": "Speaker 1", "text": "以获取样本,然后你再次运行训练。嗯,你看到在你运行生成的时候,这些样本中的一些" }, { "i": 20, "speaker": "Speaker 1", "text": "会非常长。所以,在很长一段时间内,你的 GPU 基本上只是空闲着。嗯,这是一个非常大的问题。你的 GPU 基本上在大部分时间里都是空闲的。" }, { "i": 21, "speaker": "Speaker 1", "text": "那么我们能做些什么来解决这个问题呢?一种方法是进行异步 RL。我们基本上将生成和训练重叠进行。我们进行生成,运行一个生成步骤,得到大量样本。我们用这些" }, { "i": 22, "speaker": "Speaker 1", "text": "样本进行训练,同时我们也在同时运行生成。我们始终同时运行生成和训练。我们重叠它们,我们" }, { "i": 23, "speaker": "Speaker 1", "text": "同时进行。 所以我们看到但问题是当你运行训练时 你训练所用的数据可能是由几步之前权重生成的。所以它不是" }, { "i": 24, "speaker": "Speaker 1", "text": "所以你的数据来自于一组不同的权重,而不是你正在训练的权重。这意味着异步 RL 是离线策略。所以数据生成策略,数据生成权重 是旧的" }, { "i": 25, "speaker": "Speaker 1", "text": "与 与训练策略相比,与你正在训练的权重相比。还有 管道 RL,它更进一步。 所以管道 RL 我们做这些" }, { "i": 26, "speaker": "Speaker 1", "text": "像飞行中的权重更新。所以当你生成一个轨迹时,对于智能体任务,这些轨迹可以变得非常长。 我们基本上说如果我们正在生成一个轨迹,并且中途" }, { "i": 27, "speaker": "Speaker 1", "text": "在轨迹过程中有一组新的权重就绪,我们只需中途换入一组新的权重,然后从那里继续轨迹,因此你可以有样本" }, { "i": 28, "speaker": "Speaker 1", "text": "由不同的权重集生成 这非常酷, 是的,我们可以看看管道 RL 与像离线离策略的比较,我们看到管道 RL 通常稍微" }, { "i": 29, "speaker": "Speaker 1", "text": "高效一些 但它们都收敛到大致相同的上限 管道 RL 中还有一个非常重要的参数,即你愿意训练的数据有多旧" }, { "i": 30, "speaker": "Speaker 1", "text": "所以 K 所以这里的八只是意味着 你仍然在训练 你可能正在训练由八步前权重生成的数据。" }, { "i": 31, "speaker": "Speaker 1", "text": "所以我们可以看到,像4和8这样的值通常是可以的,但一旦你到了像12这样的数值,差异就变得太大了,然后算法就开始停滞不前了," }, { "i": 32, "speaker": "Speaker 1", "text": "不再起作用了。 所以这是你需要非常小心的一点。 好,这部分更多是关于基础设施方面,我们如何处理 off policy 在基础设施方面。 算法方面呢" }, { "i": 33, "speaker": "Speaker 1", "text": "在损失方面?嗯,那么我们如何处理离线策略在损失方面的问题呢?我们采用一种叫做重要性采样的方法。所以,我们现在先忽略这个术语。" }, { "i": 34, "speaker": "Speaker 1", "text": "所以这里的术语基本上是策略梯度。所以这就是 RL 的损失函数。嗯,但这里这个问题在于你有学习器和采样器,它们是不同的。嗯" }, { "i": 35, "speaker": "Speaker 1", "text": "你的采样器通常比学习器稍旧一些。所以在这里我们基本上添加了一个不同的项,或者我们添加了这个比例来纠正这种不匹配。 所以我们基本上添加了这个" }, { "i": 36, "speaker": "Speaker 1", "text": "这个术语基本上是学习者概率除以采样器概率,用于纠正这种分布不匹配。" }, { "i": 37, "speaker": "Speaker 1", "text": "呃,所以你可以对如何精确处理这个问题做很多数学运算。呃,有一个非常流行的 GRPO。所以他们处理这个比例的方式是,他们把这个比例进行裁剪。" }, { "i": 38, "speaker": "Speaker 1", "text": "所以理想情况下我们总是希望这个比例大约为一,因为理想情况下采样策略和训练策略应该非常接近。所以我们希望它在" }, { "i": 39, "speaker": "Speaker 1", "text": "理想情况下是1,但有时这个比例会变得非常不稳定。因此在GPO中,他们基本上将这个比例限制在1减去epsilon到1加上epsilon之间。然后" }, { "i": 40, "speaker": "Speaker 1", "text": "还有,这是来自字节跳动的一个非常流行的算法。他们意识到,使用GRPO时,策略的熵实际上会迅速崩溃。这是因为剪裁限制了信任区域,但它也限制了策略的探索程度。因此,他们提出了一个" }, { "i": 41, "speaker": "Speaker 1", "text": "叫做‘剪裁更高’的策略。字面意思就是剪裁得更高。当你进行剪裁时,在上限端你只需设置一个更高的epsilon。因此,你得到" }, { "i": 42, "speaker": "Speaker 1", "text": "一种不对称剪裁。此外还有GSPO,他们采用序列级别的重要性采样,而不是在词元级别上进行重要性采样,我们可以在整个" }, { "i": 43, "speaker": "Speaker 1", "text": "序列上进行重要性采样。然后还有syso,是的,有很多变体。之前我们是通过剪裁词元更新来实现的,这意味着我们基本上会丢弃那些" }, { "i": 44, "speaker": "Speaker 1", "text": "比例偏离太大的词元。在这里,他们提出我们其实不想丢弃词元,我们能不能直接剪裁?他们提出了一个技巧,直接剪裁重要性采样权重,以" }, { "i": 45, "speaker": "Speaker 1", "text": "稳定训练。我们可以看到不同的损失函数如何影响不同的渐近上限。因此在这个设置中,syso和gbo表现得相当不错。你看到曲线" }, { "i": 46, "speaker": "Speaker 1", "text": "比如 实际上运行得还不错。但在这个案例中,像 dappo 实际上很快就达到了平台期。所以对于不同的领域,你真的需要选对算法,否则" }, { "i": 47, "speaker": "Speaker 1", "text": "否则你就无法获得足够好的奖励。好的。现在我想进入一个在大规模 RL 中实际上最大的挑战之一,即 RL 中的训练与推理差异。所以这是" }, { "i": 48, "speaker": "Speaker 1", "text": "一个有点奇怪的问题。基本上,你的训练堆栈和推理堆栈是为完全不同的目标进行优化的。因此,这会导致很多固有的不匹配,仅仅是因为" }, { "i": 49, "speaker": "Speaker 1", "text": "不同的内核精度。在训练中,你可能会使用像 VLM 这样的精度,而在推理中,你可能使用的是 Megatron。所以这意味着,即使对于完全相同的权重," }, { "i": 50, "speaker": "Speaker 1", "text": "你从训练堆栈和推理堆栈中得到的结果也可能非常不同。所以在这个图中,我们看到我们有完全相同的权重、完全相同的数据点," }, { "i": 51, "speaker": "Speaker 1", "text": "我们从训练堆栈和推理堆栈中得到概率,它们应该是相同的。如果它们相同,它们应该围绕红线排列,但现实中我们看到它们实际上在" }, { "i": 52, "speaker": "Speaker 1", "text": "红线周围散开。有时候它们实际上彼此差异很大,尽管这仅仅是用完全相同的方式、完全相同的数据运行。所以这实际上在" }, { "i": 53, "speaker": "Speaker 1", "text": "RL 中是一个非常大的问题。所以有一篇中国的论文。在他们的情况下,他们原来的算法根本不起作用。所以如果你看那边的灰色曲线," }, { "i": 54, "speaker": "Speaker 1", "text": "然后他们意识到哦,我们在不同层和不同组件之间存在相当大的训练与推理差异。所以他们深入研究并逐一解决了这些问题。首先他们修复了" }, { "i": 55, "speaker": "Speaker 1", "text": "KV 缓存中存在一些精度不匹配,只需修复这一点,你就能得到棕色曲线。所以只需修复这一点,算法就开始正常工作了,然后他们又修复了类似更多的问题" }, { "i": 56, "speaker": "Speaker 1", "text": "归一化注意力和rope,然后你就会看到,就像 一个一个地修复它们,算法就变得越来越好,最后你就能得到一个你得到红色的" }, { "i": 57, "speaker": "Speaker 1", "text": "曲线在 RL 训练中表现得相当稳定。所以在 RL 的论文中,他们也做了类似的事情。他们采用了一种方法,基本上是将这些矩阵乘法转换为 FP32 格式" }, { "i": 58, "speaker": "Speaker 1", "text": "训练和推理。所以你看到通过这个技巧之后,之前这个技巧之前我们有很多分散的值,但之后就更加集中在" }, { "i": 59, "speaker": "Speaker 1", "text": "数值更加集中和对齐,仅通过这个精度修复,你可以看到那边的曲线,他们获得了大约17%的相对上限提升。所以仅通过修复精度你" }, { "i": 60, "speaker": "Speaker 1", "text": "你可以在很大程度上影响你的训练表现。嗯,这也非常危险,因为如果你看那条橙色曲线,看起来好像没什么问题,但其实不清楚到底发生了什么" }, { "i": 61, "speaker": "Speaker 1", "text": "是错误的。嗯,这些差异并不是显而易见的错误。呃,它们只是默默地损害你的表现。呃,你真的想要尽量减少这种差异,以" }, { "i": 62, "speaker": "Speaker 1", "text": "稳定的 RL 训练。在 RL 训练中我们还做了什么?我们还做了自适应采样。有一种技巧叫做零方差过滤。它非常简单。它基本上说我们有很多问题。其中一些太难,一些又太容易。" }, { "i": 63, "speaker": "Speaker 1", "text": "如果太容易,模型总是得到一个奖励值为1,或者总是得到很高的奖励。如果太难,模型总是得到奖励值为0。所以我们只是" }, { "i": 64, "speaker": "Speaker 1", "text": "跳过这些样本。在训练过程中我们直接丢弃它们,只专注于那些模型有时能解决、有时不能解决的数据点。这真的" }, { "i": 65, "speaker": "Speaker 1", "text": "将训练计算资源集中在学习前沿。此外,无正样本重采样也非常简单。随着训练的进行,模型开始掌握一些问题。" }, { "i": 66, "speaker": "Speaker 1", "text": "其中一些问题虽然仍然通过零方差测试,但它们对学习的回报已经非常有限。因此在无正样本重采样中,我们" }, { "i": 67, "speaker": "Speaker 1", "text": "跟踪每个提示的历史通过率。如果模型能解决这个问题超过90%的时间,我们就丢弃它。这样我们可以逐步" }, { "i": 68, "speaker": "Speaker 1", "text": "专注于更难的问题。在训练过程中,这可能表现为从大约5,000个问题开始,模型学会解决其中的约200个问题,然后我们" }, { "i": 69, "speaker": "Speaker 1", "text": "只是丢弃那些。因此,我们逐渐拥有的训练问题越来越少,专注于那些真正具有挑战性的问题。因此,计算机从不会浪费在那些……该模型已经掌握。" }, { "i": 70, "speaker": "Speaker 1", "text": "而且通过自适应采样,我们看到这真的提高了计算效率,仅通过这两个非常简单的技巧。有时它们还会提高上限,这是 这还挺酷的。 所以 yeah 我们谈到了 scale RL 的配方。" }, { "i": 71, "speaker": "Speaker 1", "text": "所以我们讨论了不同的损失函数,比如 GPO dapple 和 sispo,以及训练和推理之间的差异。这两个因素真的会影响上限,以及就像上限能有多高 怎么样" }, { "i": 72, "speaker": "Speaker 1", "text": "high your performance can get。我们还讨论了离线策略和自适应采样,这些真的会影响你的效率,比如你的模型学习速度有多快" }, { "i": 73, "speaker": "Speaker 1", "text": "在这些问题上进行学习。所以这是一场信息密度很高的技术讨论。我们学到了什么?我们了解到,我们自己的训练遵循这种S型曲线的扩展模式。所以" }, { "i": 74, "speaker": "Speaker 1", "text": "这与幂律不同。我们了解到,不同的方法会有不同的性能上限,而且我们可以通过小规模训练运行来预测大规模性能。我们还" }, { "i": 75, "speaker": "Speaker 1", "text": "谈到了很多不同的权衡,比如 off policy 的 自适应采样和不同的 RL 算法。 它们也以不同的方式影响 扩展。有些影响效率,有些影响" }, { "i": 76, "speaker": "Speaker 1", "text": "的 的偷窃。 所以是的。所以是的,我希望你从你的下一次 RL 训练运行中获得一些见解。" }, { "i": 77, "speaker": "Speaker 2", "text": "你好。 这个配方的通用性如何?" }, { "i": 78, "speaker": "Speaker 1", "text": ",我认为它非常通用。我认为,是的,我认为这是一种非常系统的方式来思考 RL 扩展。所以,我认为它非常通用,而且很可能是一个" }, { "i": 79, "speaker": "Speaker 1", "text": "非常好的起点。我想象如果你有非常具体的问题,你可能会喜欢稍微调整一些东西,但通常来说,我认为它非常通用。" }, { "i": 80, "speaker": "Speaker 3", "text": "是的。我很好奇,为什么你认为形状是 sigmoid 形状?,这是我的第一个问题。第二个问题是,是否存在任何根本性的限制,限制它能达到多高" }, { "i": 81, "speaker": "Speaker 1", "text": "的上限?是的,这是一个好问题。,我认为因为 RL 是如此不同,好的,RL 与深度学习非常不同。在深度学习中,你是在一个固定的数据集上进行训练。,在 RL," }, { "i": 82, "speaker": "Speaker 1", "text": "你的模型是在生成你用来训练的数据。所以,我认为一旦你的模型达到足够好的水平,突然就会获得很多非常有价值的学习点。所以," }, { "i": 83, "speaker": "Speaker 1", "text": "它会迅速起飞。嗯,这就是我猜测为什么它的形状是S型的。嗯,是的。至于天花板,嗯,确实存在一些根本性的限制。嗯" }, { "i": 84, "speaker": "Speaker 1", "text": "我们在这里讨论的内容包括你使用的算法,以及训练和推理之间的差异,如果差异太大,就无法很好地工作。嗯,是的,我认为这些是算法的一些限制。" }, { "i": 85, "speaker": "Speaker 4", "text": "是的,在算法方面。" }, { "i": 86, "speaker": "Speaker 1", "text": "这和基础模型有多大关系呢?比如,哦,是的,如果基础模型非常差,天花板就会非常高。我认为基础模型的能力会影响两者。" }, { "i": 87, "speaker": "Speaker 1", "text": "所以,如果有一个强大的基础模型,可能可以非常快速地提升,但对于较差的基础模型,可能需要更长时间。我认为它会影响两者。" }, { "i": 88, "speaker": "Speaker 1", "text": "实际上,对我来说并不太清楚它对天花板的影响有多大,因为我认为一些小模型实际上非常有能力,只要你训练它足够长的时间。" }, { "i": 89, "speaker": "Speaker 4", "text": "训练足够长的时间。嗯,是的。" }, { "i": 90, "speaker": "Speaker 1", "text": "这是你们根据它来做的吗?呃,我想,呃,不是,不是,在这篇论文中没有那么强调,但我认为是的,你会看到像 Cursor 这样的东西,比如 composer 2.5,即使你没有最大的模型" }, { "i": 91, "speaker": "Speaker 5", "text": "比如,如果你在足够高质量的数据上训练足够长的时间,你就可以取得相当不错的进展,是的。 我认为在前面的问题中,其中一个原因是 RL 呃" }, { "i": 92, "speaker": "Speaker 5", "text": "奖励函数是有限的,对吧?所以最终你会遇到一个瓶颈,但如果你使用动态方法,它就是依赖的,这让我想到了我的问题。所以," }, { "i": 93, "speaker": "Speaker 5", "text": "很高兴我们可以预测,所以我们可以从小规模开始,找到它会去往哪里,但我想知道在它的创新方面是否存在权衡,或者我们是否" }, { "i": 94, "speaker": "Speaker 5", "text": "知道它是否会逐渐被淘汰,我之所以问这个问题,是因为比如假设我们有1958年的原始神经网络论文,受限于计算能力,我确信他们很快就会遇到瓶颈" }, { "i": 95, "speaker": "Speaker 5", "text": "他们很快意识到,我们无法在这方面进一步改进,是的。 但比如,假设我们有100,000 GPU 小时,我们会遇到瓶颈,无法再进一步改进。" }, { "i": 96, "speaker": "Speaker 5", "text": "但我们实际上并不知道1000万小时是否能实现这一点。如果我们真的固定在基于配方的机器学习方法上,我想知道其中有多少是我们在放弃的" }, { "i": 97, "speaker": "Speaker 5", "text": "那些可能最终会成功的创新,比如自适应采样,这确实是一个非常棒的方法。比如说,当它达到某个任务的90%、95%准确率时" }, { "i": 98, "speaker": "Speaker 5", "text": "它可能会降低采样区域,这可能是一两个非常罕见的情况,可能会真正挽救生命,而我们可能没有进行采样因为我们会认为自己在那个特定任务上已经做得非常好,然后进行降采样。" }, { "i": 99, "speaker": "Speaker 5", "text": "所以我我想问,如果这个问题太长了,我很抱歉,但你如何看待可预测性好与创新空间之间的权衡" }, { "i": 100, "speaker": "Speaker 1", "text": "有多大。嗯,这是一个非常好的问题。我认为一般来说事情是相当可预测的,比如如果你看一下学习曲线,一旦你达到某个点" }, { "i": 101, "speaker": "Speaker 1", "text": "你就不会比这再进一步了。在创新方面,我认为这仍然是非常早期的工作,系统性地思考这些事情" }, { "i": 102, "speaker": "Speaker 1", "text": "这些方面的事情。所以,我觉得在⟶0⟶方面的一切都还非常早期。还有很大的扩展空间,我们甚至还没谈到扩展,比如扩展" }, { "i": 103, "speaker": "Speaker 1", "text": "环境数量、扩展领域数量,这些方面还有很多可以做的事情。所以我认为,人们确实应该在不同的动画上进行工作,比如" }, { "i": 104, "speaker": "Speaker 1", "text": "自适应采样,我觉得这是人们想出的一些非常简单的技巧,但我觉得人们应该继续在动画上进行工作 嗯,是的" }, { "i": 105, "speaker": "Speaker 6", "text": "嗯,超级达布装配,对于这些问题的基本类型,我们认为模型已经足够好,可以解决 但是,是否有可能在丢弃这些代码和代码容易" }, { "i": 106, "speaker": "Speaker 6", "text": "的问题之后,模型会逐渐倾向于更针对那些非常难的问题的技术或技能。是的。作为回报,会导致那些文化问题的回归,这存在一定的风险,比如这种困难。" }, { "i": 107, "speaker": "Speaker 1", "text": "是的。是的。这是一个非常好的问题。我认为,这还没有被很好地研究。实际上,我认为一些自适应采样的方法并不太有原则性,因为它" }, { "i": 108, "speaker": "Speaker 1", "text": "会以意想不到的方式改变你的训练分布。嗯,是的,我认为人们应该更深入地研究这一点,我认为它会以非常意想不到的方式改变行为,比如有时候" }, { "i": 109, "speaker": "Speaker 1", "text": "你的模型可能会因为过度训练某些特定类型的问题而表现出非常奇怪的行为。所以是的,我认为" }, { "i": 110, "speaker": "Speaker 7", "text": "人们应该非常小心这一点。嗯,是的,我知道大多数都是基于结果的奖励。我们有没有研究过基于过程的奖励的上限,或者我们对此有任何扩展研究吗?" }, { "i": 111, "speaker": "Speaker 1", "text": "嗯,是的,我认为在很多领域,人们使用奖励模型或评分标准。我认为这些扩展规律在大多数情况下仍然成立嗯,可能有一些奖励黑客行为,但总体上仍然成立。" }, { "i": 112, "speaker": "Speaker 7", "text": "在基于过程的奖励方面。我不太确定。我确实, 有很多奖励塑造的案例。所以他们做了很多奖励塑造。在大多数情况下,这只是一个二进制重新排序。嗯,你认为三重性有类似的上限代码吗?" }, { "i": 113, "speaker": "Speaker 1", "text": "是的,我觉得我见过非常简化的 奖励设置,其中你确实会得到像每一步的不同部分奖励,并对它们进行求和。,所以我认为在这些" }, { "i": 114, "speaker": "Speaker 1", "text": "情况下,它仍然成立,但如果你进入像更细致的流程情况,比如非常奖励某些流程中的特定部分是的。我不太确定。我不太确定那里的情况。是的。我认为那可能看起来会有所不同。是的。在那边。" }, { "i": 115, "speaker": "Speaker 8", "text": "是的。这真的很有趣。它让我从产品角度思考得更多。我在想,是否应该开始对那些我们推送出去并交付的模型进行标记,基于" }, { "i": 116, "speaker": "Speaker 8", "text": "这个预测性指标,对吧?比如,是否应该用这个标签作为标记,表示我们认为模型所处的位置及其潜力,或者没有" }, { "i": 117, "speaker": "Speaker 1", "text": "是的,我认为这会非常有用。实际上,是的,评估模型的潜力真的很困难,即使是开源的中文模型,比如你仅仅通过微调它,就可能得到非常令人惊讶的结果。" }, { "i": 118, "speaker": "Speaker 1", "text": "所以我认为,是的,我认为这肯定非常有趣。" }, { "i": 119, "speaker": "Speaker 8", "text": "反过来想,我觉得这可能有用,但这也像是一个内部基础漏洞,我只是一个产品拾取者,或者你觉得这会对开放领域有用吗?" }, { "i": 120, "speaker": "Speaker 1", "text": "我认为这肯定对开放科学有用。我觉得这会非常有趣。嗯,我不确定在这一点上经济激励如何对齐。不过,我觉得这确实是非常有趣的研究。" }, { "i": 121, "speaker": "Speaker 8", "text": "很酷。好的。谢谢,Bobby。非常感谢。" } ]