EPISODE· generated 2026-08-06 12:49:37· 1h 9m

Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview

Stanford Online
Stanford Online· original aired 2026-08-03

想深入了解?以下在线课程涵盖了本课程内容:- XCS329 研究生课程:https://online.stanford.edu/courses/cs329a-self-improving-ai-agents - Agentic AI 专业教育项目:

自我提升智能体课程stanfordcourse overview
ready · seed-vc · qwen3-tts
0:00/0:00

⚠ The Chinese audio is an AI-generated dub (speech synthesis / voice conversion), not a real recording and may contain errors. Based on the original English interview; all rights remain with the original creator.

original lang
EN
dubbed into
中文 (ZH)
pipeline
Plan C · voice conversion
voice model
seed-vc · qwen3-tts
001
Akanksha
欢迎大家来到秋季学期,也欢迎来到 CS 329A。希望你们都来对了教室。这门课讲的是自我改进的 AI 智能体。有人来对教室了吗?
002
Speaker 1
是的?
003
Akanksha
好的。你们当中有多少人在斯坦福读硕士?
004
Speaker 1
博士?
005
Akanksha
好的。有几位,然后是本科生?好的。所以硕士生是这里的大多数。比例很均衡。是的。比例真的很好。嗯,那么我们来做个自我介绍。我是 Akanksha。
006
Akanksha
我一直从事大语言模型的研究工作,目前是斯坦福的兼职教授,同时也在一家名为 Reflection AI 的初创公司做研究。
007
Azalia Mirhoseini
大家好,我是 Azalia Mirhoseini。我是计算机科学系的助理教授,我和 Akanksha 是在 Google Brain 工作时认识的。
008
Azalia Mirhoseini
是的,回想过去,还有 Google DeepMind。
009
Azalia Mirhoseini
我也曾在 Google DeepMind 从事 Code、Anthropic 和 Gemini 的相关工作,我们非常兴奋能再次讲授这门课程。
010
Azalia Mirhoseini
这是我们第二次授课。当然,我们对讲座内容以及我们在课程期间开展各项活动的具体方式都做了一些更新。人们对加入这门课程所表现出的浓厚兴趣让我们感到惊叹不已。
011
Azalia Mirhoseini
所以,我们很高兴你们能在这里。
012
Akanksha
课程网站位于 cs329a.stanford.edu。我们已经更新了网站,包括所有讲座材料、你们需要阅读的论文,以及作业时间表,让你们了解项目提案和项目
013
Akanksha
结构等方面的安排。因此,在今天的讲座中,我们将首先概述大型语言模型。简要回顾过去五年中扩展趋势的演变,然后我们将更专注于本课程将涵盖的内容。
014
Akanksha
随后,在讲座的后半部分,我们将介绍课程行政事务,这部分你应该格外关注,因为它会影响你的成绩。那么,让我们先来看看大型语言模型趋势的概述。
015
Akanksha
自 GPT-3 发布以来,令人惊叹的一个方面是,随着模型参数数量的增加,模型性能会提升;这意味着像 BERT
016
Akanksha
和 T5 这样的语言模型虽然不错,但随着我们增加参数数量,它们的性能变得非常出色。
017
Akanksha
它们的表现要好得多,这导致了一种被称为大型语言模型的缩放损失(scaling loss)的现象,即在构建预训练基础模型时,随着计算量的增加,损失会下降。
018
Akanksha
这里有三张图表。随着 x 轴上计算量的增加,y 轴上的损失函数值下降;你投入的计算量越多,测试损失就越低,从而导致模型性能更好。
019
Akanksha
因此,这是导致 GPT-3 以及随后所有 ChatGPT、PaLM、Gemini 等出现的一个重要方面。同样地,随着 x 轴上数据集规模的增加,y 轴上的测试损失会进一步下降。
020
Akanksha
所以,这是另一个方面的扩展轴,它有助于提升语言模型的性能。第三个方面当然是参数量。
021
Akanksha
因此,如果你增加 Transformer 中的层数或语言模型中的参数量,这会降低损失值,从而带来更好的模型。这一趋势长期以来一直是基础,直到去年开始触及某种饱和点。
022
Akanksha
所以,从 2018 年到几乎 2024 年,这张图表有点过时了,但从 2018 年到 2024 年,随着模型规模几乎持续增加,我们一直在扩大模型的规模。
023
Akanksha
所以,我们最初有像 BERT 这样拥有 3.4 亿参数的模型,GPT-2 有 15 亿参数,然后 GPT-3 有 1750 亿参数,接着 PaLM 有 5400 亿参数,随后又有一系列后续模型,而据估计 GPT-4 拥有万亿级参数。
024
Akanksha
所以,你可以想象,大型语言模型的规模经历了指数级增长。“大型”正是指它们在规模上的增长,这也是模型性能提升的关键领域之一。
025
Akanksha
正如我刚才解释的,随着模型变大,它们在自然语言基准测试、各种其他基准测试以及推理基准测试上的表现持续改善,等等等。
026
Akanksha
然后另一个有趣的方面是我稍后会向大家展示的,即它们学会了如何进行少样本学习。
027
Akanksha
所以,以前你需要针对特定领域对模型进行微调,但现在只需提供几个示例,模型就能遵循该模板并以类似的方式进行推理,这使得原型开发变得极其容易。
028
Akanksha
然后第三个方面是,随着模型变大,它们会出现涌现行为,其中诸如推理等能力仅在较大规模的模型中才会显现。所以,为了理解这里的少样本学习或零样本学习。
029
Akanksha
所以,如果给模型一个类似的问题或任务,比如将英语翻译成法语,它能够给出……这被称为提示(prompt)。
030
Akanksha
比如给它一个任务:将英语翻译成法语,然后要求它将“cheese”翻译成对应的法语单词。如果模型能够在未经特定任务训练的情况下预测出答案,那就称为零样本学习。
031
Akanksha
而对于少样本学习,除了提供任务描述外,你还提供几个示例。
032
Akanksha
所以在这种情况下,它被要求将英语翻译成法语,并给出了几个从英语到法语的翻译示例,然后要求它翻译“cheese”,它能够完成翻译,你可以看到这一点
033
Akanksha
这种能力在大语言模型中针对大量任务都显现出来,这一直是 GPT-3、PaLM 和其他模型所推动的关键领域之一,随后的创新也源于此方面的推理特性。
034
Akanksha
所以在推理方面,随着模型变得更大,它们展现出了一种推理的涌现行为,Azalia 将对此作进一步介绍。
035
Azalia Mirhoseini
因此,随着模型规模增大,我们不仅拥有这种可预测的缩放定律特性——即我们知道在投入更多算力、数据和参数时损失函数会如何下降——模型中还会出现以前没有的新行为,在我们拥有这些更大模型并观察到这类行为之前,我们根本无法预测它们。
036
Azalia Mirhoseini
它们的行为。其中最重要的行为之一就是涌现的链式思维(chain of thought)行为。对于不熟悉这一概念的朋友,以下是它的工作原理。
037
Azalia Mirhoseini
在通常的模型提示中,我们可以向模型提出一个问题,比如一道数学题,然后提供一个单样本示例。这是一道数学题,这是答案。现在我问你一个相似但不完全相同的数学问题,模型需要给出回答。
038
Azalia Mirhoseini
嗯,模型可能会利用这个单样本示例,也可能不会。但我们可以通过不仅提供示例,还给出得出该答案的推理过程或链式思维,来做得更好。在这种情况下,问题非常简单。
039
Azalia Mirhoseini
Roger 有五个网球。他又买了两罐网球。每罐有三个网球。他现在总共有多少个网球?与其只说 11,不如这样说:嗯,Roger 一开始有五个球。
040
Azalia Mirhoseini
两罐每罐三个网球共六个。然后 5 + 6 等于 11。通过这个示例,模型就熟悉了得出答案的过程,并能利用这一过程来解答新问题。嗯,显然这是一个非常简单的问题。
041
Azalia Mirhoseini
如今任何像十亿参数级别的模型都能解决这个问题。不需要示例、少样本提示或思维链。但思维链
042
Azalia Mirhoseini
这一特性本身至今仍具有显著价值,对于推理模型和所有思考型模型而言,这是一个极其重要的特性,也是我们在过去一年左右所看到的许多进展中的关键所在。
043
Azalia Mirhoseini
现在,随着我们拥有越来越大的模型,这一特性再次显现出来。这里有三个模型:Lambda、GPT 和 PaLM。正如你所见,这是思维链在数学数据集上的一些结果。
044
Azalia Mirhoseini
数学数据集。当这些模型较小时,比如 Lambda 的八十亿参数或 GPT 的约七十亿参数,它们实际上无法从思维链中获益。就像它对它们没有任何作用一样。
045
Azalia Mirhoseini
但当它们变得更大时,或者对于同样为八十亿参数的 PaLM 模型而言,它可以利用这一思维链特性,并从上下文中提供的推理过程和学习过程中受益,从而更好地解决问题。
046
Azalia Mirhoseini
不仅如此,随着模型规模的增加,还出现了其他解决新任务的能力。例如,小型模型突然能够更好解决模运算问题或单词重组问题,仅仅因为具备了更大的规模和这一特性。
047
Azalia Mirhoseini
你会发现这种能力在达到一定规模时突然出现。正因为如此,作为前沿公司和实验室的我们仍然对推动缩放定律感兴趣,不仅是为了获得自然的进步,而且我们
048
Azalia Mirhoseini
我们将看到越来越多这类涌现行为,这将是至关重要的。现在,稍微回顾一下历史。所以 ChatGPT 于 2022 年 11 月推出。显然,它是迄今为止最成功的应用或软件之一。
049
Azalia Mirhoseini
它达到 100 万用户的时间仅为 5 天,这比你在图中看到的其他任何著名软件或服务都要快得多。
050
Azalia Mirhoseini
除了扩大模型参数规模之外,还有一些创新要素对于造就 ChatGPT 的成功、使其实现相对于 GPT-3 等先前模型的跨越式发展至关重要。
051
Azalia Mirhoseini
这里有两个重要的方面,即指令微调(instruction tuning)和……
052
Azalia Mirhoseini
基于人类反馈的强化学习(RLHF)。我们将在接下来的幻灯片中简要提及这些内容,但在整个课程中,我们将更深入地了解它们。
053
Azalia Mirhoseini
嗯,首先……然后我们将更详细地学习所有这些内容,但让我们先退一步,看看整个过程是如何运作的。所以,预训练步骤是任何语言模型训练的起始阶段。
054
Azalia Mirhoseini
这是最简单的一步,我们只是训练模型从各种文本和数据中预测下一个 token。然后是微调步骤,这是 ChatGPT 这类模型的关键差异化因素。
055
Azalia Mirhoseini
嗯,让我们先从微调的第一个方面开始,即与人类……偏好的对齐。
056
Azalia Mirhoseini
所以,当模型经过预训练后,它虽然见过互联网、书籍等各处的大量数据,但它没有对错的概念;它只是在统计上了解世界状态,但并不确切知道事实或如何遵循指令。
057
Azalia Mirhoseini
因此,训练这些模型的下一步是…………我们试图引导 AI 模型遵循人类的目标、偏好和价值观的步骤。
058
Azalia Mirhoseini
嗯,这仍然是一个大问题,一个重大挑战,我们尚未完全掌握它,但随着模型的进步,它们在能力方面正变得更好且更强大。事实证明,我们可以对模型进行微调以实现对齐。
059
Azalia Mirhoseini
例如,这里有一些图表显示,如果我们取一个仅经过预训练的基础模型,并针对合理性或安全性对其进行微调,会发生什么。这些是我们收集的数据。
060
Azalia Mirhoseini
高质量数据,用于向模型展示我们所说的安全与不安全、合理与不合理分别指什么。这些是经过更多精心策划、高度筛选的数据,我们将其输入模型进行微调,以使模型更贴合人类的价值观或偏好。
061
Azalia Mirhoseini
嗯,那么回过头来,让我们再次梳理一下这个过程。
062
Azalia Mirhoseini
所以,当我们拿到一个预训练语言模型时,第一步是使用下一个 token 预测进行微调,这遵循与预训练相同的过程,但这次使用的是质量高得多的数据。
063
Azalia Mirhoseini
例如,这些数据可能来自书籍、创意文章,或者是公司花费数百万甚至数亿美元购买的高质量数据,然后我们在这些数据上对模型进行微调。结果,模型的性能因此得到了显著提升。
064
Azalia Mirhoseini
嗯,下一步是指令微调。所谓指令微调,我们的意思是,在过去两年中,这种指令微调数据传统上是由人类生成的数据或模板以及合成数据组合而成的。
065
Azalia Mirhoseini
但是,这种指令微调的工作方式是,我们提供指令以及问答对,让模型学习如何遵循问题并给出答案。例如,这里有一个用于微调的数据集指令,可能是关于天气的,比如“请回答以下问题”。
066
Azalia Mirhoseini
氮的沸点是多少?然后这就是答案。或者,我们可以进行思维链微调,向模型展示它如何通过一系列步骤推导出答案。然后我们有标签,也就是这里的结果。这就像这些配对
067
Azalia Mirhoseini
即问题、指令和答案的配对。同样,在这个数据集上投入了大量精力,数据集的质量和通用性对我们在这个阶段获得的模型质量有很大影响。
068
Azalia Mirhoseini
嗯,到了这个阶段之后,模型变得越来越像我们今天看到的模型。你可以向它们提问,可以与它们进行来回对话。它们具备了一种感知问题以及如何通过某种流程得出答案的能力。
069
Azalia Mirhoseini
指令微调之后的下一步是使用人类偏好并根据这些偏好对模型进行微调的过程。这个过程称为 RLHF,即基于人类反馈的强化学习。
070
Azalia Mirhoseini
嗯,这与之前系统的不同之处在于我们创建目标函数和生成数据的方式。因此,在这种情况下,我们不仅仅是创建一些监督式提示和标签,而是基本上基于人类偏好构建一个奖励模型。
071
Azalia Mirhoseini
因此,公司花费大量资金询问人类——有时是专家,有时只是普通大众——关于模型生成的问题和答案的反馈。我们请人类对这些内容进行评分,以判断哪些是正确的,哪些是不正确的。
072
Azalia Mirhoseini
这就是我们在此构建某种奖励模型的方式。嗯,这个奖励模型取代了人工反馈,我们可以利用它来引导我们的大语言模型(LLM)的参数,使其生成的答案符合该奖励模型的标准。
073
Azalia Mirhoseini
因此,基本上,我们希望模型的生成结果能让奖励模型评价为:“是的,这些是好的生成内容。”
074
Azalia Mirhoseini
嗯,我们将在此深入了解这一点,但我希望你先对 RLHF(基于人类反馈的强化学习)的含义有一个高层面的理解。呃,我们可以收集不同类型的奖励,即多种奖励类型。
075
Azalia Mirhoseini
例如,我们可以要求模型根据答案的正确性、有用性、具体性或无害性等标准对一对答案进行奖励评估,这些都是我们可以定义的各类奖励函数。并且
076
Azalia Mirhoseini
根据我们希望模型具备的特性以及我们最关注的方面,我们可以为这些不同的奖励模型分配权重,并在 RLHF 过程中加以应用。
077
Azalia Mirhoseini
因此,从高层面来看,这些步骤——当然其中投入了大量精力——包括预训练,然后在更高质量的数据上进行微调、指令微调以及 RLHF,这些都是使 ChatGPT 这样的模型区别于 GPT-3 及更早的所有大型模型的核心组件。
078
Azalia Mirhoseini
因此,这在模型的优秀程度和能力方面带来了巨大的差异。嗯,直到去年或一年半前,预训练和微调都是主要的环节,这非常酷。
079
Azalia Mirhoseini
呃,但自一年半前以来,事实证明推理(inference)也是提升模型能力的一个重要前沿领域。嗯,这开启了一整套新的研究方向、路径和方法,让我们能够进一步提升模型性能。
080
Azalia Mirhoseini
嗯,那么让我们稍微讨论一下这一点。比如这是我们实验室在去年夏天所做的一项工作。它被称为“大型语言猴子”(Large Language Monkeys)。
081
Azalia Mirhoseini
嗯,这在某种程度上受到无限猴子定理的启发,并且与推理扩展有关。嗯,你们中有多少人听说过无限猴子定理?好的,这个比例不错。
082
Azalia Mirhoseini
所以,无限猴子定理的概念是——虽然它并未被严格证明——但它说的是,如果你有一只猴子和一台打字机,然后我们一直
083
Azalia Mirhoseini
让这只猴子不停地打字,日复一日,永无止境,经过一段时间后,猴子打出的内容中将包含威廉·莎士比亚的全部作品。嗯,因此我们受此启发来命名我们的项目。
084
Azalia Mirhoseini
呃,但这里的想法是,让大语言模型充当那只猴子,然后反复要求模型解决给定的输入问题。你可以将其视为并行采样或并行生成。因此,与其只问模型一次来解决输入问题,你可以多次询问它。
085
Azalia Mirhoseini
此外,假设你拥有某种验证器或选择机制,这样你就可以选出这些生成的响应中哪一个是正确的。然后你在系统中输出那个结果。这就成了最终输出。
086
Azalia Mirhoseini
因此,模型不是只生成一个答案,而是生成许多、许多个答案。然后你的验证器会选择出其中正确的那个,并输出其中一个正确的结果。嗯,你可以将验证器理解为,比如说,一些单元测试。
087
Azalia Mirhoseini
如果问题是生成代码,验证器可以是我们针对代码运行的单元测试,我们看看哪个代码生成结果通过了所有单元测试,等等。嗯,这之所以非常重要,是因为模型生成的响应存在一定的方差。
088
Azalia Mirhoseini
它不是确定性的。你甚至可以使用一个叫做“温度”的参数来控制模型响应的变化程度。因此,当你提问时,你可以强制或鼓励模型生成更多样化的回答。嗯,现在让我们看看这种重复采样的部分结果。
089
Azalia Mirhoseini
对于数学和编程基准测试等大量任务,我们将每个问题的采样数从 1(这是常规情况)增加到了 10,000。这里我们展示的是覆盖率,或者说被这些样本中至少一个解决掉的问题所占的比例。
090
Azalia Mirhoseini
我们看到的情况是,红线,也就是那条红色虚线,代表的是 GPT-4 模型。
091
Azalia Mirhoseini
而这些蓝色和绿色的线,分别代表 Llama 2 8B、Llama 3 8B 和 7B 模型,在单次采样时表现不如 GPT,
092
Azalia Mirhoseini
但如果我们增加这些模型的采样数量,在所有这些案例中,它们的表现都优于 GPT-4 模型。这说明什么呢?似乎模型本身已经掌握了比你只问一次时所能获取到的多得多的知识,对吧?
093
Azalia Mirhoseini
所以,这就是推理扩展(inference scaling)背后的基本属性,因为看起来只要我们引入这种推理扩展,就能从这些模型中获得更多的能力和解决问题的能力。
094
Azalia Mirhoseini
这里你展示的是重复采样,但实现这一目标的方法还有很多种。之所以称之为推理扩展,是因为我们并没有触碰模型的任何参数。
095
Azalia Mirhoseini
模型是固定的,我们只是在推理阶段,创造不同的方式来生成输出,从而产生更高质量的答案或解决更难的问题。
096
Azalia Mirhoseini
嗯,这里有趣的一点是,对于某些问题,在这 10,000 个解决方案中,可能只有三四个是正确的。这表明扩展推理对于真正挖掘模型的核心能力有多么重要。
097
Azalia Mirhoseini
抱歉,刚才的问题是什么?所以,这些可能的答案需要由模型以某种方式生成,对吧?也就是说,模型所有可能答案的空间要大得多,对吧?如果我们进行树搜索或随机搜索,这个空间会大得多,对吧?
098
Azalia Mirhoseini
没有任何方法能像想象让人类坐下来解决这个问题那样去覆盖它,对吧?当然,人类的创造力是没有极限的,但我们在能进行的迭代代数上是有上限的,对吧?
099
Azalia Mirhoseini
或者如果你在做随机化,可以生成大量的答案,而且这仍然具有非常高的采样效率,对吧?
100
Azalia Mirhoseini
10,000 并不算多,尤其是例如对于数学问题,其中一些问题真的很难,比如国际数学奥林匹克(IMO)级别的问题。
101
Azalia Mirhoseini
像这些真正困难的问题,即使是像 7B 或 Llama 8B 这样的小模型也能解决。
102
Speaker 2
它的延迟表现如何?当你实际生成所有样本时,与 GPT-3 等相比,延迟对比是怎样的?比如延迟方面
103
Azalia Mirhoseini
是的,当然存在权衡,我们在讲座中提到了这一点,我会对此进行更详细的说明。并行样本的好处在于它们可以并行运行。
104
Azalia Mirhoseini
所以从延迟角度来看,这不太是个问题,但当然在计算资源投入与成本之间存在权衡,我们会深入探讨这一点。而且它会变化,具体取决于问题的类型和复杂度。
105
Azalia Mirhoseini
当你有验证器时,事情会容易得多。这是一个非常困难的问题。
106
Azalia Mirhoseini
当你没有验证器时,有一整套研究是关于如何训练 LLM 进行判断、作为奖励函数,或让 LLM 结合工具使用,我们将学习所有这些内容。我们有一整节专门讲验证器的课程,所以……
107
Azalia Mirhoseini
不,是的,我们不能让温度设置得太高,因为那样只会产生胡言乱语,模型无法生成有效内容。实际上,去年有一个研究项目就是关于调整温度或确定最佳温度值的。
108
Azalia Mirhoseini
通常,如果超过 1.2 左右,效果就不太好了,是的。但还有其他技巧可以让模型在答案类型上具有更多多样性,这可能会很有用。呃,好吧。嗯,那么,我们来看看这个。
109
Azalia Mirhoseini
所以,现在,再次回顾去年、一年半前的事件,我们有 DeepSeek 模型。我认为它是在 十二月发布的。DeepSeek 在 2023 年 12 月发布。
110
Azalia Mirhoseini
呃哦,好吧。它已经发布了一段时间还是很久,我不知道。两者都有。呃所以,像 DeepSeek 这样的模型是去年发布的。
111
Azalia Mirhoseini
所以,基本上,DeepSeek 的核心创新以及 Gemini 的 01 系列思考等功能在于。
112
Azalia Mirhoseini
现在,我们某种程度上将这种微调与测试时缩放结合在一起,因为通过这种测试时缩放和模型本身,我们拥有了一种新的引擎,可以生成大量合成数据,例如,对于像数学问题这样我们知道答案的问题,我们可以让模型生成不同的、导向最终那个黄金答案的答案。
113
Azalia Mirhoseini
或者对于编程问题,我们可以在测试时缩放期间使用模型生成大量数据,大量高质量的数据来解决编程问题,这些数据现在成为我们训练集的一部分。我们可以用它来微调模型,使其变得更好。
114
Azalia Mirhoseini
所以,将这两者结合起来成为了思考模型和推理模型中的一个重要部分。嗯,这是一个非常重要的领域。这里有很多值得探索的地方,因为再次强调,这是开放式的,对吧?
115
Azalia Mirhoseini
在测试时缩放方面,模型能变得多好是没有界限的,然后将其反馈到训练模型或微调模型以使其变得更好的过程中是非常令人兴奋的,这就是我们非常兴奋的自我改进部分。
116
Azalia Mirhoseini
嗯,所以,稍微谈谈推理模型。嗯,在语言模型中,我们展示的是覆盖率。比如,如果我们能访问验证器,我们可以看到随着样本数量的增加,呈现出一种对数线性的缩放规律。
117
Azalia Mirhoseini
嗯,OpenAI 在去年九月发布 o1 时,他们展示了 pass@1 与这些高难度 MMLU 基准测试之间呈对数线性关系,正如我所说的,这是一个非常……
118
Azalia Mirhoseini
嗯,OpenAI 在去年九月发布 o1 时,他们展示了 pass@1 与这些高难度 AIME 基准测试之间呈对数线性关系,正如我所说的,这是一个非常……
119
Azalia Mirhoseini
困难的数学问题。所以,他们在这里展示的是,随着推理时计算量的增加——这是在对数尺度上——模型的准确率(pass@1 准确率)会上升,而且这仅针对推理阶段。
120
Azalia Mirhoseini
此前,这种现象已在训练阶段得到证实,但有趣的是,这种缩放规律同样适用于推理阶段,而无需改变模型的参数量。
121
Azalia Mirhoseini
嗯,我将通过一两个例子来演示这种推理或推理时缩放机制在 o1 或 Gemini 等模型中是如何工作的。
122
Azalia Mirhoseini
这里的动机之一是,对于难题,就像人类会花更多时间思考、考虑多种策略一样,推理模型也会这样做,它们可能会使用思维链或其他技术来解决问题,其中包含不同的步骤。
123
Azalia Mirhoseini
例如,问题分析是一个步骤,即模型首先看到问题并尝试进行分析。然后它可以进行任务分解,将任务拆分为更简单、更易处理的子任务。接下来是自进化策略,其中模型……
124
Azalia Mirhoseini
尝试某种方法,观察反馈,例如对代码运行测试、使用计算器,或者仅仅判断答案,并利用这些反馈来优化自身。还有自我修正和替代方案;如果某件事行不通,模型可以回溯并尝试不同的方法。
125
Azalia Mirhoseini
这些是模型的关键原则,其中一部分可能在训练过程中由人类策划的训练数据集中进行训练,但很大一部分也是模型在微调过程和强化学习……比如基于合成数据的强化学习过程中习得的技能。
126
Azalia Mirhoseini
嗯,这里有一个 o1 如何进行分析的示例。嗯,模型被要求编写一个 bash 脚本,该脚本接收一个矩阵,然后输出该矩阵的转置。模型开始像人类一样思考,首先思考这里的重要部分是什么?
127
Azalia Mirhoseini
所以,用户请求的是一个 bash 脚本,让我们理解这个矩阵的输入和输出格式等等。所以,模型只是进行思考,令人惊叹的是,这就像是一种思维链的演进过程。
128
Azalia Mirhoseini
这有助于模型找到答案,但思维链与这种情况的区别在于,是模型自身在生成这条思维链。
129
Azalia Mirhoseini
嗯,当然还有任务分解,比如在这种情况下,对于这种方法,模型会思考如何解析输入、将矩阵构建为数组的数组等等。
130
Azalia Mirhoseini
嗯,还有自我纠正,这是一个非常重要的部分,我不确定你们中有多少人见过在使用模型时可以看到思维痕迹的情况。
131
Azalia Mirhoseini
呃,这其实很常见,比如模型开始做某事,然后在中间说:‘等等,正确的方式……可能有什么不对。’嗯,或者‘也许我需要修正那个地方。’模型能够自行做到这一点,真的非常酷。
132
Azalia Mirhoseini
嗯,所以当推理模型出现时,比如像 O1 这样的模型,与 GPT-4o 这样的模型相比,在哪些模型上,它们显然在推理任务方面表现更好。
133
Azalia Mirhoseini
例如,在数学计算、数据分析、编程等方面,它们都在一定程度上优于 GPT-4o,但在个人写作或编辑文本等方面则不一定如此。是的。有问题吗?
134
Speaker 3
你认为这种提升是因为要求模型进行推理过程,还是仅仅因为让模型思考或使用思维链这一行为本身?比如,如果你一步步思考但不大声说出来,即不实际生成那些存在的思维过程,只是不说出来
135
Azalia Mirhoseini
嗯,我重复一下问题。你的意思是,你认为推理模型之所以成为它们现在的样子,是基于外显的思考方式吗?
136
Akanksha
我认为问题是,这是出于推理过程的原因,还是出于一步步思考的原因?即思维链。
137
Azalia Mirhoseini
比如,模型能够完成所有这些步骤,像分解问题、能够回溯、能够进行分析,所有这些都是模型在思维优化过程中学到的技能,现在可以泛化到其他事物上,并且正在帮助模型。
138
Azalia Mirhoseini
所以,我认为另一种看待它的方式是像 Ali 所展示的重复采样。所以,如果你只是在预训练后使用一个基础模型,它就能够进行一些推理。
139
Akanksha
但同时,它会生成各种不同类型的推理链,而且它并不完全清楚哪一个是正确的。因此,我们将在训练时间或测试时间扩展中涵盖的许多内容,归根结底就是让它学会判断哪个是正确的。
140
Akanksha
所以,一次通过率(pass at one)的准确率会上升,这就是你在推理模型中看到的情况,而不是像 pass at K 或覆盖率那样,那是你在重复采样结果中看到的情况。
141
Akanksha
是的。
142
Azalia Mirhoseini
还有另一种思考方式,即是的,这种深度思考以及模型生成的内容实际上每次都在帮助模型解决新问题。嗯,虽然让模型生成这些内容成本非常高,但我们仍然希望它生成,因为这能带来更好的答案。
143
Azalia Mirhoseini
嗯,还有其他问题吗?有。你在处理推理部分和生成最终答案时使用的是不同的模型吗?
144
Azalia Mirhoseini
比如也许用一个更小或概率性的模型专门用于推理,而最终答案是 嗯,通常推理能力会随着模型规模的增大而提升。
145
Akanksha
嗯,通常推理能力会随着模型规模的增大而提升。所以,如果有什么的话,你会使用更大的模型来进行推理轨迹,然后也许你收集一堆推理轨迹,再让一个较小的模型来总结答案。
146
Azalia Mirhoseini
是的。所以,对于这类模型来说,至少目前是这样,情况可能会改变,它们更倾向于自己的推理轨迹。即使这些轨迹来自更好的模型,它们往往也更喜欢自己生成的轨迹。
147
Azalia Mirhoseini
我们将要讨论 Swirl,这是我们之前提到的关于多步推理的论文之一 多步推理 我们谈到的多步推理。如果我们引入不同的模型,不是在生成推理轨迹的语境下,而是在评估和提供反馈的语境下。
148
Azalia Mirhoseini
我们也会看到这一点。但令人惊讶的是,或者说不那么令人惊讶的是,模型非常喜欢自己的轨迹。
149
Speaker 4
对于推理模型,它们是如何被教导进行推理的?是硬编码的一组序列,还是被教导去做轨迹,或者以某种方式微调来说,“你需要做这么多或这类事情,这将导致轨迹生成。”
150
Akanksha
所以,我认为没有已发表的作品真正涵盖这一部分。呃 两者都有,是的。但它是两者的结合。同时,基础模型一开始就具备思考能力,对吧?它会进行一定程度的思考。
151
Akanksha
我们课程中会涵盖的一件事是结果奖励模型和过程奖励模型的概念,以及如何利用这些反馈让模型得到改进。
152
Azalia Mirhoseini
是的,总是有一些引导。比如,好的,这里有不同的方法。比如,思维链本身,这在指令调用的数据集中被广泛使用,向模型展示了一些思考的方式。可能还有一些模板用于模型的微调。
153
Azalia Mirhoseini
但是,如果你只是问它任何问题,它会提出这些,这里有很多泛化能力。所以,模型已经远远超出了用于训练它们的数据或指令的范围。
154
Speaker 4
呃,你能重复一下是否有办法使样本数量依赖于问题吗?
155
Akanksha
请大声说话。样本数量,它们可以取决于问题的难度吗?我认为没有已发表的研究工作做过这一点。
156
Speaker 1
呃,不过是的,
157
Azalia Mirhoseini
我们只是……所以,因此,有相关的后续研究,其中我们使用奖励模型,然后你可以利用它。
158
Azalia Mirhoseini
所以,假设奖励模型对复杂度有一定的概念,如果你还没有解决它,它可以指导进行更多的采样,无论是重复还是并行。呃,但这绝对是一个值得探索的有趣方向。
159
Akanksha
好的,我们需要进入下一个话题,我们还没做到。对。是的,让我来涵盖这些内容。好的,所以你现在了解了大型语言模型,然后你听到了它们是如何学习思考的,接着又是如何学习推理的。
160
Akanksha
那么,接下来是什么?为什么这门课程是相关的?所以,这门课程的很多内容在于,大型语言模型作为聊天机器人或推理模型,基本上仍然是单轮交互式的,或者仅仅是聊天格式的。
161
Akanksha
所以,它们并没有为你完成某项任务。与它们互动很有趣,但它们不一定能为你完成某项任务。
162
Akanksha
今年几乎在最近几个月发生的一件令人惊讶的事情是,像 Claude 或 Deep Research 这样的智能体真正使人们能够执行现实世界的工作流。
163
Akanksha
所以,它们是智能体工作流,可以端到端地完成你要求它们执行的任务。所以,例如,如果你想进行研究并弄清楚如果我想在斯坦福大学上课,我应该在哪里租房子住一整年。
164
Akanksha
模型实际上能够进行大量分析,查看许多不同的网站,并总结结果,给出不同地点的优缺点。这在以前是不可能的。所以,这部分将简要介绍这如何成为可能,以及本课程如何帮助你了解这些内容。
165
Akanksha
然后以 Claude Code 为例,你们中的任何人都Codex 是 OpenAI 的编码智能体,如果你在使用它,你会发现只需通过英文指令,你就可以修改文件,或者找出测试用例等等。
166
Akanksha
所以,目前它确实已经成为软件工程师日常工作流程中的一种编码生产力工具。那么,从 LLM 到智能体的转变是什么?
167
Akanksha
正如我之前举的 Deep Research 和编码智能体的例子,基本上现在的目标是模型可以被赋予一个目标,它会规划步骤,然后与环境交互,并根据反馈修正其步骤,直到实现目标,或者它会返回来说‘我无法实现目标’。
168
Akanksha
所以,这种拥有某种目标概念、朝着该目标采取行动、获得反馈,然后决定何时停止的理念,正是使智能体不同于你之前所做的聊天机器人时代之处。
169
Akanksha
而且,这也可能需要与模型本身操作范围之外的外部工具进行交互,从中获取一些输入,但它仍然保持在所选任务的轨道上,这可能意味着它必须具备某种形式的记忆来跟踪其试图完成的任务。
170
Akanksha
那么,已经取得了什么进展?所以,在几种情况下,在更简单的案例中,你可以实现这些端到端的目标,比如 Deep Research 可以端到地完成。
171
Akanksha
但是,在大多数场景中,你之前所做的聊天机器人时代。
172
Akanksha
而且,这也可能需要与模型本身操作范围之外的外部工具进行交互,从中获取一些输入,但它仍然保持在所选任务的轨道上,这可能意味着它必须具备某种形式的记忆来跟踪其试图完成的任务。
173
Akanksha
那么,已经取得了什么进展?所以,在几种情况下,在更简单的案例中,你可以实现这些端到端的目标,比如 Deep Research 可以端到地完成。
174
Akanksha
但是,在大多数场景中,你仍然拥有非常静态的工作流程。所以,目前存在的是更接近智能体工作流程的东西,其中你有某种输入,你给模型一个目标,然后
175
Akanksha
这张幻灯片向你展示的是,一个模型或许给出输出,比如一个解决方案,然后另一个模型对其进行评判,并据此决定该解决方案是否应被接受。所以,这是一种可能的编排框架。
176
Akanksha
Deep Research 将更多属于第二种情况,即你基本上针对多个可能的输入调用 LLM,然后聚合这些内容以获得输出,这将是深度研究结果的摘要。
177
Akanksha
所以,这是一个非常卡通化的抽象概念,展示了智能体工作流可能是什么样子的,你可以从中进行推广。但不同于我在这里展示的非常开放式的循环,即你
178
Akanksha
应该从环境中采取一个行动,然后回来做一些反馈。嗯,对于开放式问题来说,更容易手动构建这样一个图,展示人类会如何操作,然后通过 LLM 获取反馈,也就是这里的 LLM 评估器。
179
Akanksha
所以,许多现实世界的工作流仍然遵循这种范式,但在某些情况下,我们开始看到一些迹象表明这种幻灯片编码是可能的,研究则是另一个例子。通常,这些工作流会包含类似 LLM 调用的内容。
180
Akanksha
基本上,你会用指令或某种形式的输入调用一个 LLM,然后要求 LLM 给你输出结果。它还会包含某种形式的验证器。我们将在单独的一课中详细讲解验证器。
181
Akanksha
它还可能包含某种形式的批评者或评判者,这实际上是 LLM 作为评判者的范式。可能会有工具调用。例如,在进行深度研究时,你需要实际搜索网络以确定你应该查看的具体内容是什么。
182
Akanksha
所以,可能会有这种形式的工具调用,或者获取关于天气的具体信息。嗯,同样地,搜索也会是另一种工具调用。然后你会以某种形式编排这些工作流。所以,这里最简单的工作流就是提示链。
183
Akanksha
类似于推理模型,任务被分解为子任务,提示链只是将你完成一系列不同的子任务以达成端到端目标的过程串联起来。可能会有路由机制。
184
Akanksha
路由适用于复杂任务,你可以说:‘如果这个任务非常复杂,那就执行更复杂的 LLM 调用集;如果不太复杂,就执行更简单的工作流。’
185
Akanksha
嗯,可能存在并行化的情况。深度研究就是一个例子,你可以让多个 LLM 调用同时工作,去研究你作为输入提供给它的不同关键词
186
Akanksha
然后最终汇总输出结果;或者你可能将任务分解为独立的子任务,然后再组合这些解决方案。
187
Akanksha
或者你可能会遇到这样一个概念:编排器(Orchestrator)。用简单的话来说,就是 LLM 编排器,其中核心的 LLM 实际上负责进行规划。
188
Akanksha
所以,在 Claude Code 中,你开始看到确实存在……你可能会有一个评估者或裁判。
189
Akanksha
因此,与其从现实世界的用户那里获取反馈,或者从某种实际运行的单元测试中获取反馈,它实际上可能只是使用 LLM 作为裁判,我们将有一些作业来然后你可能还会有验证器。
190
Akanksha
验证器是指那些可以实际验证输出的东西。所以,以代码为例,如果你运行了这段代码,你怎么知道这段代码是正确的呢?因此,通常作为软件开发人员,我们会编写单元测试。
191
Akanksha
嗯,同样地,验证器可能会运行某种单元测试,以检查 LLM 生成的内容是否正确。
192
Akanksha
而在那些可验证的领域,比如数学、代码,以及其他更多基于规则的领域,这种验证是一种向模型提供反馈的好方法,以便它纠正自己的步骤。
193
Akanksha
因此,这些工作流程中的大多数都意味着 LLM 需要在规划方面做得更好。它需要在多步推理方面做得更好,并且需要在自我改进方面做得更好。比如当它
194
Akanksha
犯错时,它需要能够自我纠正。所以,有效地说,这些是当前的 LLM 仅靠推理能力尚未完全实现的新范式,这些也是我们在后续讲座中计划涵盖的一些主题。
195
Akanksha
为了进一步强调关于编码智能体的观点,这是一个非常简单的例子。
196
Akanksha
这实际上……我应该把幻灯片更新为 Claude Code,但基本上,这里展示的是你有一个 LM 智能体,如今它主要通过终端与计算机交互。你给它一个指令,你可能会告诉它你想实现一个
197
Akanksha
任务,然后它会进行一些仓库导航、文件搜索,所有这些都涉及查看文件、编辑行等工具调用,接着它会在终端中执行一堆命令,并根据输出结果,它可能会想:‘好的,我需要去编辑另一个文件,或者我需要去看看另一个文件。’
198
Akanksha
所以,如果你看这个循环,这非常类似于呃去年的情况,那时还不太可靠,而现在我们在编码智能体领域看到的正是它开始变得可靠。我的意思是,我认为范式基本上是一样的。
199
Akanksha
这主要取决于更强大的模型,以及更好的强化学习。带有可验证奖励的强化学习正在起作用。训练时间的扩展效果良好。我的意思是,这是计算机数据,对吧?
200
Akanksha
是这两者之一,但除此之外,一旦模型开始变好,自我改进循环就会启动。
201
Speaker 1
是这两者之一,但除此之外,一旦模型开始变好,自我改进循环就会启动。
202
Akanksha
呃,因为你现在可以生成任务,而且任务变得更加可靠。
203
Akanksha
所以,在已发表的研究成果中,如果你看比如我们去年编写的 Code Monkeys,如果你能为模型生成的任何代码生成单元测试,然后看看这些生成的单元测试是否让事情变得更好,那么这就是验证结果的一种非常好的方法,对吧?
204
Akanksha
是的,就像基于模型的方法。看起来在某种程度上,如果我们拥有良好的验证器,我们就能让模型生成正确的代码。嗯,但问题是我们该如何做到这一点?
205
Azalia Mirhoseini
而且确实有方法可以实现。我们也乐意让你们在这个领域开展研究项目。但显然,这是一个活跃的研究领域,不过有一些改进方法我们可以讨论。你所暗示的是生成器-验证器差距这一概念。
206
Azalia Mirhoseini
所以,模型很容易生成大量胡言乱语、看似合理的推理轨迹或有用的一组内容。
207
Akanksha
内容。但归根结底,无论这是否有用,我们都需要为此建立反馈循环。如果你在进行创意写作,你能获得多少反馈呢?因此,人类反馈最终成为了瓶颈。
208
Akanksha
在那些能够获得良好反馈的领域,才有可能持续改进模型。然而,获得稳健的验证非常困难,大量的稳健验证更是难上加难。
209
Akanksha
所以,Azalia 将介绍她在实验室所做的一篇论文,内容涉及如何组合验证器。但验证仍然是该领域提升模型性能的主要瓶颈之一。
210
Akanksha
嗯,就像直觉上那样,在预训练阶段,你获得了发现相同逻辑能力的能力。
211
Speaker 5
所以,对我来说,直觉上我正在试图弄清楚为什么会出现显著下降。因为就像我们在分割他们所知道的知识一样。而我们拥有逻辑能力,我想这些在预训练中不应该存在 嗯哼。
212
Speaker 5
在预训练阶段。
213
Speaker 1
嗯,所以,是的,我想我并没有完全认同这一点,我认为这仍然是一个活跃的研究领域。因此,对于什么真正能改进模型,存在不同的观点。是强化学习(RL),还是仅仅依靠预训练中的多样化数据?
214
Akanksha
而且我认为目前还没有达成单一共识。这两个过程都有帮助。嗯,你刚才说的,我会为全班重复一遍,就是如果预训练是这样一个地方:模型在经过多次采样后,如果在生成大量样本时至少能有一个正确的解决方案,那么这种提供反馈的概念应该能提高 pass@1 的准确率,但不应该改进模型本身。为什么会有如此巨大的飞跃?但我认为整个循环还没有被完全理解。这就像是模型的初步迹象
215
Akanksha
模型的迹象。是强化学习,还是仅仅依靠预训练中的多样化数据本身?而且我认为目前还没有达成单一共识。这两个过程都有帮助。
216
Akanksha
嗯,你刚才说的,我会为全班重复一遍,就是如果预训练是这样一个地方:模型在经过多次采样后,如果在生成大量样本时至少能有一个正确的解决方案,那么这种提供反馈的概念应该能提高 pass@1 的准确率,但不应该改进模型。
217
Akanksha
为什么会有如此巨大的飞跃?但我认为,整个循环尚未被完全理解。这就像是 AI 的早期迹象它开始商业化,但我觉得在这个领域仍有大量研究空间。所以,这只是思考这一问题的一种方式。
218
Akanksha
还有其他一些迹象表明,你可以继续进行强化学习(RL),而这将进一步提升模型性能。是的。好的。
219
Akanksha
所以,这基本上涵盖了相同的要点,但从这张图表中值得提取的一个抽象概念是:即使你给模型设定了一个目标,它也必须澄清用户的意图。所以,用户想要什么对它来说并不总是显而易见的。
220
Akanksha
然后它可能会搜索相关文件,无论它选择采取何种行动,很多时候它需要某种形式的验证。在这个特定案例中,它是基于通过测试,它甚至可能生成需要通过的测试用例,这也在这里提到了。
221
Akanksha
但关键思想是:如果你给它一个任务,它如何返回结果,你又如何知道它会完成你所要求的内容?很多时候用户并没有足够清晰地定义问题。
222
Akanksha
因此,澄清用户意图以便它知道该查找什么以及如何验证,变得越来越重要。在像 GPT-3 这样的模型中,我认为他们已经看到了许多端到端的轨迹。
223
Akanksha
所以,他们能够进行规划、推理、多步推理并得出最终结论,但完成端到端任务或实现端到端目标需要大量此类能力。这在重复性任务中非常有用,例如代码迁移、版本升级,或者当你需要重构代码库时。
224
Akanksha
或者如果你涉及数据工程的任务,你需要提取数据并对数据进行清理,或者进行某种 数据仓库迁移。所以,这类工作往往极其重复,将其委托给编码智能体要容易得多。
225
Akanksha
单元测试也是如此,很多时候让编码智能体来处理要容易得多。智能体变得极其普及的另一个领域是客户支持。
226
Akanksha
这是最吃力不讨好的工作之一,当你身处客户支持岗位时不得不做,而使用大语言模型(LLM)来做这件事确实能以有趣的方式简化体验。因此,一个简单的例子集就是你可以用它们来进行实时转录。
227
Akanksha
这为你提供了非常清晰的记录,而且你甚至会在如今的会议中看到这种情况。另一个简单的例子是知识辅助。因此,如果你有一个信息数据库,客户支持智能体不需要知道所有事情。
228
Akanksha
他们可以咨询大语言模型并获取答案,从而展示相关文章,这比仅仅依靠索引搜索要好得多。智能回复。
229
Akanksha
因此,在聊天中,这种情况已经存在一段时间了,但你可以使用智能体来提供聊天回复,然后拥有通话摘要可以帮助你……你也可以利用通话摘要本身来真正改善客户体验。
230
Akanksha
因此,总体而言,我认为在客户支持领域,有多家公司正在涉足这一领域,但呃,问题的不同部分可以通过大语言模型来解决,它们非常有用,而且端到端的应用也开始在这里出现。
231
Akanksha
然后我们将使用的第三个例子,实际上也是部分作业内容是,如果你有很复杂的话题并且想提供一份综合报告,以前你需要做文献综述,然后总结每篇论文,再综合这些信息,而如今你可以直接交给大语言模型让它为你完成,并且它可能会研究比你更多的文章。
232
Akanksha
因此,通常如果你给它一个例子,比如呃说 2022 年冬奥会开幕式,它会识别需要查阅哪些参考文献,然后它
233
Akanksha
会构建一个大纲,判断这些参考文献是否相关,然后总结每篇参考文献中的相关内容,最后将它们组合成一篇完整的文章,这在某些情况下非常令人印象深刻,你将在其中一项作业中尝试它。
234
Akanksha
然后甚至更前瞻性的……这些研究智能体开始被用作人工智能科学家。因此,基本上,它们开始协助科学家解决数学问题或科学问题。
235
Akanksha
在这里,大语言模型在想法生成阶段被用作头脑风暴工具来提出创意,然后在实验迭代阶段,它实际上可能帮助你迭代你希望开展的实验。这出自《人工智能科学家》论文。
236
Akanksha
然后在论文撰写阶段,它会自动帮助你改进论文的撰写。
237
Akanksha
有趣的是,尽管这些模型会产生幻觉,但仅仅因为它们作为 AI 科学家能够提出如此多不同类别的想法这一概念,实际上就能进行头脑风暴,或者给出超出你原本设想范围的想法——如果你只是修了一堆课程,或者作为一名研究人员在该领域深耕多年,有时让 LLM 阅读网络数据能让它们想出完全跳出框架的想法,这可以成为一种非常有效的头脑风暴方式。所以这些在 AI 科学家风格的工作中超级有用。
238
Akanksha
工作风格。好的,那么让我们进入课程后勤安排,但在此之前,大家有什么问题吗?
239
Speaker 6
为了澄清一下,推理和思维链是内置于训练中的,还是仅仅通过提示工程偶然发现了大型模型中的这类能力?如果是这样,除了我们的推理和思维链之外,你认为还有哪些涌现行为可能会被发现?
240
Akanksha
所以呃,我的意思是,它并非设计时就内置的,基本上是被发现的。也就是说,我们给它一些难题,然后我们发现通过拥有推理链,它的表现更好。
241
Akanksha
GSM8K 是第一篇显示出这种迹象的论文,然后在像 Palm 这样更大的模型中,我们实际上发现这是一个非常重要的事情,
242
Akanksha
其中一个例子是它能够解释笑话,这非常令人印象深刻,从此推理模型便应运而生。所以它并非如此,但它阅读了整个网络,因此它肯定看到了更多更具条理性和系统性的数据。
243
Azalia Mirhoseini
但是推理模型是被训练得越来越善于推理,对吧?所以整个推理并不是一个涌现行为。推理模型被训练去思考,但像模型是收敛的,所以模型将被训练成知道何时需要大量推理,何时不需要,并生成答案。
244
Azalia Mirhoseini
但是思维链最初是一种涌现行为。他们注意到,哦,如果我们向模型解释事情,效果会更好。大型模型中的涌现行为。
245
Akanksha
我不认为它是……我会将其视为涌现行为本身,但正如我提到的,我们通常是在寻找某些特定事物,对吧?所以在智能体工作流中,我们要找的是规划,这是一种推理形式。
246
Akanksha
我们在寻找多步推理,这在课堂上也会涵盖。然后我们在寻找自我改进或自我纠正。
247
Akanksha
所以,所有这些能力都是锦上添花的。至于如何让模型具备这些能力,有一系列值得探讨的问题,这方面也有相关的论文研究。
248
Azalia Mirhoseini
比如自我纠正、回溯等这类行为,你可以称之为涌现现象,但也可以认为它们在微调过程中被强化过,因为模型已经见过这类行为模式。所以嘛,确实很难下定论。
249
Azalia Mirhoseini
好的。嗯,那我们来看一下课程的具体安排。嗯,这里列出了你们将要学习的所有精彩主题。嗯,它们就是……嗯,是的。这非常酷。
250
Akanksha
我认为这里需要记住的主要一点是,整体主题保持不变,同时我们还将邀请来自 Frontier AI Labs 的嘉宾进行讲座,
251
Akanksha
涵盖从后训练(post-training)的演变到多模态智能体乃至机器人学等广泛内容。所以,这将是一个混合形式,包括常规讲座、嘉宾讲座,当然还有项目展示环节。
252
Azalia Mirhoseini
那么,这里有一些大家应该知道的后勤安排信息。只需确保你在注册课程时对这些先修要求感到舒适即可。所以,我们有一个外部网站,但请务必查看 Canvas。
253
Azalia Mirhoseini
我们会随时在那里发布最新通知。嗯,而且我们会在每节课开始前上传讲座视频,以便你们可以提前观看。呃,我们还会列出所有作业和项目的截止日期,大家可以自行查看。
254
Azalia Mirhoseini
嗯,所以,本季度我们将布置三次家庭作业。这是本课程与其他课程之间的一个区别,也是差异之一。
255
Azalia Mirhoseini
所以,我们为大家设计了一项额外的精彩作业,助教们做得非常出色,这有助于你们更深入、更透彻地学习这些主题。嗯,此外我们还有一个课程项目。
256
Azalia Mirhoseini
所以,在课程项目中,你可以尽情发挥创造力,探索构建智能体系统的方式,或者深入探讨某个问题,并围绕它设计实验,看看哪些方法有效,哪些无效。
257
Azalia Mirhoseini
嗯,我们会提供一些示例或建议,但如何设计这个项目完全由你决定。我们会有去年的一些例子,包括去年成功的项目案例。
258
Azalia Mirhoseini
呃,这些内容会上传到 Canvas 上。或者实际上,我们会把它们展示在网站上。哦,是在网站上。哦,太棒了。是的。是公开网站,所以你们都能看到。
259
Akanksha
嗯,好的。关于课程项目,我认为主要要记住的是,我们会提供 API 额度,你可以以两到四人为一组进行合作。
260
Azalia Mirhoseini
对吧?是的。或者说最多四人,我是说两到四人。好的。如果你真的想的话,也可以一个人做。我们建议你们组队合作。嗯,至少这样你们总共会有更多的额度,从而可以运行更多实验。
261
Azalia Mirhoseini
但在这个过程中,你也可能会找到志同道合的朋友或合作伙伴,从而做出更宏大的项目。嗯,我们将会有这个……这是什么?课程项目。是的,我们会告知你们一些往年的情况以及一些你可以借鉴的想法。
262
Azalia Mirhoseini
嗯,以下是一些可接受的项目示例。例如,一个新的评估数据集或一个新的基准测试。你可以围绕现有智能体系统的可靠性来设计一个项目。
263
Azalia Mirhoseini
你可以选取一个现有的基准测试,并用你任何出色的想法对其进行爬山优化。嗯,或者你也可以只是……这门课会涵盖大量论文,我们会把这些都展示给你们看。
264
Azalia Mirhoseini
它们都在网站上。因此,在我们进行讲座时,我们期望你们也阅读这些论文,或者在过程中边读边学,从而对这些方法如何运作形成更好、更深刻的直觉。
265
Azalia Mirhoseini
你的项目可以始终致力于改进这些方法,或者质疑他们所做的某个决定,并尝试改变它或评估它。嗯,反面例子包括综述论文之类的……我们只是不希望那样,我们希望这里有一些具有研究性质的内容。
266
Azalia Mirhoseini
论文之类的……我们只是不希望那样,我们希望这里有一些具有研究性质的内容。所以我们不想要那种你随便拼凑出来的应用,然后只给我们展示一些东西。它必须像这样:这是我们的假设。
267
Azalia Mirhoseini
这是我们要回答的问题。这是我们希望看到的改进类型,或是我们希望分析的特性类型,然后我们构建了相应的内容,对吧?基本上,我们想要的东西比现场编码要多得多。
268
Akanksha
嗯,就里程碑而言,我认为值得记住的是你要尽早开始。所以你需要在某个时间点提交项目提案,我认为我们把它定在了十月初。然后呃它在网站上,是的。
269
Akanksha
它在网站上,然后对于期中项目展示,我们确实希望你们有一些进展。
270
Akanksha
所以在提交项目提案后的两周内,我们确实希望你们已经开始了思考,比如到提交项目提案时你想要运行哪些实验,以便你实际去执行它们用于期中项目。
271
Akanksha
因此我们确实期望你在期中项目展示中取得一些进展。它不应该只是这里是一个提案,然后最终报告有很大的权重,然后最终海报展示 将在季度末进行。
272
Azalia Mirhoseini
嗯是的。我认为是的。
273
Speaker 5
如果你添加到它,对吧?看到这个名字我想在之前的研究中命名它,对吧?
274
Azalia Mirhoseini
我的意思是只要你做实际的工作,而不是仅仅像重用来自
275
Akanksha
嗯上个季度我们有学生从他们的项目中发表论文。
276
Azalia Mirhoseini
所以这是你可以做的,可能是你们中的一个或许多人这次再次将你的研究项目,更多地工作在上面然后将其变成出版物和会议。所以这里是我们海报展示的一个保存日期。
277
Azalia Mirhoseini
它将在12月12日下午4:00到6:00进行。所以我们希望你们到场并展示海报。会有来自业界的人士参加,在那里你们可以炫耀自己的成果,并结识新朋友。
278
Azalia Mirhoseini
这是课程的评分标准。我们共有三次作业。这占你们总评成绩的 50%,另外 50% 取决于项目表现。这些任务的持续时间大致与分配给每项任务的评分权重呈线性关系。
279
Azalia Mirhoseini
当然,我们要求你们遵守学术诚信准则。让我们再看看。办公时间将在 Canvas 上公布。你们可以在那里提问。
280
Azalia Mirhoseini
我们非常、非常鼓励大家在 EdStem 上提问,并将问题公开,这样其他人也能看到;如果你有问题,很可能别人也有同样的疑问。所以请像广播一样把信息传达给所有人。
281
Azalia Mirhoseini
再次提醒,EdStem 用于提问,而 GradeScope 则是提交项目里程碑和其他所有内容的地方。是的,包括作业等所有内容。
282
Azalia Mirhoseini
我们制定了如下迟交政策,我们认为这算是比较宽松的——毕竟我这边倾向于通融一些——但由于本学期班级规模较大,我们真的无法做出任何例外处理。所以,请明智地使用这些延期天数。
283
Azalia Mirhoseini
不允许旁听,但课程视频最终会在 YouTube 上发布。
284
Speaker 1
最终会发布。就是这样。有什么问题吗?没有?好的。好的。谢谢大家。

Comments

Sign in (top right) to comment.
Loading…