Appearance
OpenAI的Yann Dubois:为何AI进展突然感觉真实——编辑文稿
原文标题: OpenAI's Yann Dubois: Why AI Progress Suddenly Feels Real | Edited Transcript 来源: The Transcript Desk
💡 核心观点
AI进展的“突然感”源于模型可靠性跨越了实用门槛,而非能力本身的跳跃式发展。OpenAI通过后训练(尤其是强化学习)将模型从数学、编程等可验证奖励领域成功扩展到混乱的现实世界任务,标志着AI从“赢得比赛”转向“为用户创造实际效用”。当前,持续学习仍是AI最大的未解问题,模型需解决在企业环境中随时间累积知识的能力瓶颈。对于投资者而言,垂直领域“最后一英里”的集成和领域特定产品判断,是初创公司在前沿模型快速迭代下的核心价值所在。
📖 中文全文
章节时间戳 00:00 冷开场:可靠性跨越了AI工具开始让人感觉实用的门槛 00:34 Matt Turck介绍Yann Dubois、GPT-5.5、后训练、推理模型和持续学习 01:30 为何进展感觉突然:可靠性、内部AI使用反馈循环以及强化学习进入现实世界工作 04:13 模型可靠性与发布周期:降低逐步错误率并发布GPT-5.5 07:33 OpenAI如何协调垂直团队、横向能力以及后训练前沿团队 09:49 效率与测试时计算:将延迟-性能曲线左移 12:32 Yann的历程:从瑞士、多语言NLP、Stanford Alpaca到影响力驱动的工作 15:37 2026年的推理:从可验证奖励到混乱的用户实用性和逼真的评估 18:34 GPT-5.5 Thinking与Pro:更多测试时计算、更慢的答案、更高的正确概率 20:09 推理如何变得更高效:专家式搜索、回溯以及更早避开错误路径 23:23 预训练扩展、更大模型、令牌效率以及为何数据墙尚未完全到来 27:03 多模态数据、合成数据、具身AI、世界模型与常识基础 31:05 中期训练与后训练:高权重高质量数据、SFT、行为克隆与强化学习 37:21 强化学习是创造新能力还是释放预训练中的潜在能力 38:53 为何强化学习曾被认为过于挑剔,而规模使其奏效 42:17 扩展强化学习的前沿:采样成本、代理式部署、信用归属与GRPO 43:09 模型构建作为工艺与科学:先炼金术,再系统性解释和工程 45:11 任务特定后训练:快速最终阶段迭代、垂直数据集与奖励设计 48:21 跨领域泛化:横向能力、GDPval以及为何现实世界模糊性比竞赛更难 54:18 幻觉作为训练问题:SFT如何奖励自信编造,而RL如何惩罚它 56:04 负泛化、冲突指令,以及帮助性与精确性之间的权衡 58:05 通过领域优先级和数据将RL扩展到法律、医学、金融及经济的其他领域 1:00:19 评估瓶颈:模型作为裁判、GDPval、专家评分以及对自动化评估的信任 1:04:21 持续进步与不连续用户体验,加上未解决的持续学习问题 1:08:49 基础模型会吸收代理框架吗?外部工具还剩下什么? 1:11:23 初创公司应在何处构建:垂直最后一英里工作流、集成与领域特定产品判断
制作方:Transcript Desk Chrome扩展 完整视频:AI突然感觉像是跨过了一个门槛,OpenAI后训练前沿团队联合负责人Yann Dubois与Matt Turck共同解释原因。Yann的团队领导了该公司推理模型的后训练工作,包括最近的GPT-5.5发布。在这场对话中,我们将深入探讨从原始模型能力到有用、可靠系统的转变:GPT-5.5发生了什么变化,为什么强化学习正在超越数学和编程竞赛进入混乱的现实世界工作,像GPT-5.5这样的推理模型实际上是如何工作的,GPT-5.5 Thinking和GPT-5.5 Pro之间的区别,为什么后训练已成为AI最重要的前沿之一,以及为什么评估、模型作为裁判、幻觉、代理工作流、GDPval和持续学习如今成为前沿模型下一阶段的核心。Yann还分享了为什么在三年的ChatGPT之后,持续学习仍然是AI最大的未解问题之一,以及在前沿模型竞相发展之际,初创公司在哪些领域仍有巨大的构建空间。
文稿 00:02-00:34 Yann Dubois:你需要达到一定水平的可靠性,才能让这些AI工具真正有用。我认为我们在大约去年12月跨过了那个门槛,至少在OpenAI是这样。现在,我们可以信任这些模型来处理我们所做工作的很大一部分。过去的几个月令人难以置信;我们已经从专注于比赛转向为用户提供真正的实用性,这正是我们此刻所经历的。我相信最大的挑战通常是“最后一英里”。在不同的垂直领域,那个最后阶段总会留有大量的创新空间,我强烈鼓励大家继续在这方面努力。
00:34-01:27 Matt Turck:大家好,我是Matt Turck。欢迎收听MAD播客。我今天的嘉宾是Yann Dubois,他是OpenAI后训练前沿团队的联合负责人。最近发布的GPT-5.5是AI领域的另一个重要里程碑,Yann的团队与OpenAI之前顶级的推理模型(包括o3和GPT-5 Thinking)一起帮助构建了它。在加入OpenAI之前,Yann在斯坦福大学工作,他是Stanford Alpaca的共同作者——这个标志性项目开启了现代后训练研究社区的许多工作。在这次对话中,我们将深入探讨GPT-5.5实际上有哪些新内容,为什么强化学习正在从数学和编程竞赛转向混乱的现实世界工作,为什么AI进展可能感觉像是一个突然的阶梯函数,以及为什么在ChatGPT推出三年后,持续学习仍然是AI领域未解决的重大问题之一。请享受这场与Yann Dubois的精彩对话。
01:27-01:29 Matt Turck:嗨,Yann,欢迎。
01:29-01:30 Yann Dubois:嗨,Matt,谢谢邀请我。
01:30-01:54 Matt Turck:随着GPT-5.5和Claude Mythos预览版的发布,前沿AI领域又经历了疯狂的几周。感觉我们解锁了另一个阶梯式的进步,特别是在网络安全和代理编码方面。从你的角度来看,最好怎么理解这件事?事情是在加速吗?到底发生了什么?
01:56-01:57 Matt Turck:事情在加速吗?现在到底发生了什么?
01:57-03:43 Yann Dubois:是的,过去几个月相当疯狂。内部我们也能真切感受到。我认为任何正在编码的人都真正感受到了这种转变。我相信这主要有三个原因。第一,即使我认为进步实际上是连续的,但在这些AI工具变得真正有用之前,你必须达到一定水平的可靠性。我认为我们在大约去年12月跨过了那个门槛。至少在OpenAI,那时我感觉我们达到了可以信任这些模型来完成我们大部分工作的程度。所以,即使用户感觉是阶梯函数,但底层能力的增长一直是稳定的。第二个原因是,一旦你拥有了这么好的模型,你就开始加速自身的进步。这在编码方面尤其如此。由于我们内部都在编码,我们使用这些模型来帮助训练后续模型,并构建我们工作所需的研究工具。这创造了一个反馈循环,过去几个月感觉越来越快。第三件我认为我们在感受的事情是去年工作的成果。我们花了很多时间构建这些推理模型,并在强化学习(RL)上大力推进。起初,对于像o1-preview甚至o3这样的模型,它们仍然主要针对我们所说的“可验证奖励”进行了优化——即我们有真实答案并且很容易测试模型是否正确的情况。这适用于数学问题或编程比赛这样的场景。
03:46-04:13 Yann Dubois:我们已经超越了仅仅编程比赛。我们现在意识到的是,我们能够将为那些可验证奖励案例构建的许多工具,更普遍地应用于针对现实世界用例的强化学习。我认为这就是为什么现在感觉如此不同——我们是在实用的现实世界编码中看到它,而不仅仅是比赛。我们已经从赢得比赛转向对用户真正有用,这就是人们正在感受到的。
04:13-04:21 Matt Turck:好的,引人入胜。我们将深入探讨其中的很多内容,特别是关于强化学习(RL)方面。关于你提到的第一点——可靠性——这是一个工程挑战吗?到底是什么让一个模型在你说的意义上可靠?
04:21-05:11 Yann Dubois:这涉及方方面面的东西。但总的来说,由于这些是代理模型,如果你仔细想想,它们每隔几分钟就有一定概率会犯错误。它们运行的时间越长,最终答案错误的概率就越高。这是代理模型固有的一种属性。我们一直在推动的是降低每一步出错的概率。虽然在应用端有很多可靠性方面的工作——OpenAI的团队在那里做了出色的工作——但我特别指的是我们模型的可靠性,确保我们从根本上降低它们出错的概率。
05:11-05:31 Matt Turck:很好。那么,GPT-5.5——以前被称为“Spud”——是一件大事。我很好奇,从内部来看,你最引以为豪的是什么?你觉得最富挑战性的是什么?给我们讲讲团队在开发过程中感受的一些细节吧。
05:33-05:34 Matt Turck:你能给我们讲讲你们对发布这个模型的感受吗?
05:34-06:43 Yann Dubois:说实话,我们对5.5都感到非常兴奋。这是一个整个公司每个人都深度参与了构建过程的模型之一。我们现在真的感受到了这种影响;我们因为5.5而受到了很多关注,感觉就像天时地利人和。这并不总是发生,但这次就是一个非常好的模型。有点好笑的是,通常对于每个早期看起来很好的模型,我们都会非常兴奋。然后,一波怀疑开始袭来。人们会想,“等等,公司内部每个人都在吹捧这玩意儿,但实际上它在其他领域表现不佳。”然后又是一波,人们开始低估它。它经历这些周期,而内部人的感受通常取决于我们在发布时正好处于那个波动的哪个位置。这对我们的大多数模型来说都是如此。5.5在这方面并没有太大不同,但它的振幅肯定更高。人们非常兴奋,然后不那么兴奋,但现在我们已经发布了,人们对外界的接受度感到非常高兴。
06:43-06:56 Matt Turck:这个过程需要多长时间?包括那些兴奋的起伏波动——我认为这取决于具体的发布及其重要性——但我们需要说几周还是几个月?
06:56-07:32 Yann Dubois:这真的取决于具体情况。我不能透露5.5具体涉及的内容,但这取决于流水线的哪个部分在训练模型的哪个部分。我们有各种子团队,包括预训练、中期训练阶段和后训练。通常,你越是接近产品(后训练是最后阶段),迭代周期就越快。如果你更上游,迭代周期就更慢。范围可以从几个月到几天不等。
07:32-07:43 Matt Turck:GPT-5.5在代理编码、计算机使用、知识工作和早期科学研究方面特别强大。这在内部是如何运作的?
07:43-07:49 Matt Turck:是否有不同的人专注于这些特定领域?你们是如何实际取得这些成果的?
07:49-08:15 Yann Dubois:是的,我们确实有不同的团队专注于特定的用例,并在这些领域推动边界。具体来说,我的团队是负责将所有垂直改进整合到最终模型中的团队。你可以把我们看作“平滑函数”。我们有所有这些单独的改进,但我们需要确保模型不会感觉太“尖锐”或者在不同垂直领域之间行为不一致。
08:15-08:33 Yann Dubois:我们也有团队——这主要是我的团队做的事情——致力于横向改进。这些是指令遵循、函数调用,或者确定模型应该对不同问题“思考”多少之类的事情。这些都是影响每个用例的非常横向的能力。所以,我们既有垂直团队,也有横向团队。
08:33-09:01 Yann Dubois:两者对于改进模型都是必不可少的。好消息是这些领域可以相互正交地改进。你可能有多个团队在从事不同的垂直领域,对于特定的模型发布,也许只有一半的团队将他们的改进整合到了最新的运行中。然后,对于下一个版本,其他团队可能会赶上。
09:02-09:49 Yann Dubois:对于下一个模型,可能是另一半。在高层次上,这就是它的工作方式。关于我们对这个模型最引以为豪的地方,我想强调两点。首先是效率。我们显著提高了模型的性能;对于大多数任务,它现在的运行速度大约快了两倍。这是一个巨大的成就。第二,就像我之前提到的,是公司的内部协同。确保每个人都朝着同一个目标努力不是一件小事。这需要整个组织都专注于那个单一的“北极星”——在特定的时间线内构建一个卓越的模型。我为我们如何执行这一点感到非常自豪。
09:50-10:01 Matt Turck:很好。说到效率,你们实际上是如何优化的?我们是在谈论每令牌的效率,还是我们在看服务延迟?这其中有多少是AI研究,有多少是纯工程?
10:02-10:54 Yann Dubois:当我说它涉及到整个公司时,我的意思是它确实来自各个方面。它需要推理优化,但也需要模型在“思考时间”上更高效。可视化的标准方法是使用一个图表,x轴代表用于思考的令牌数量,y轴代表性能。这就是我们监控的测试时缩放曲线。研究侧重于将该曲线向左移动——使模型思考更少但保持相同水平的准确性。与此同时,推理团队在该相同的x轴上工作,但将令牌数量转换为实际延迟。最终,用户关心的是x轴上的延迟与y轴上的性能之间的关系。这就是所有事情汇聚的地方。
10:55-11:03 Yann Dubois:这是关于y轴的,这里是所有事情汇集的地方。这实际上就是GPT-5.5所实现的。这就是为什么我一直说我为公司这次发布感到无比自豪。
11:03-11:14 Matt Turck:好的,很好。让我们谈谈你。你在后训练前沿团队,你把它描述为一个横向团队。那个团队一般做什么?
11:14-12:32 Yann Dubois:笼统地说,我们是后训练组织的一部分,我的团队具体来说是后训练前沿。我们专注于三件主要事情。首先,我们决定哪些内容进入最终运行。正如我们讨论过的,有很多垂直团队,需要有人决定什么入选,什么不入选。我们也提供科学实验,让人们能够在代表最终模型的东西上进行迭代。第二,我们把一切整合在一起,并实际执行“大运行”。你可以想象,我们在大量GPU上进行训练。这需要大量的基础设施工作,但也需要大量的机器学习工作来确保所有不同的组件能够良好地协同工作。第三,我们致力于模型的横向改进。这些是垂直团队通常不关注的事情。例如,“思考时间”——决定模型在回答某些问题之前应该思考多久。我们也处理指令遵循、函数调用、记忆以及适用于整个栈的一般性改进。这就是后训练前沿团队的工作,我领导这个团队。
12:32-12:33 Matt Turck:好的,很好。你到OpenAI的经历是怎样的?
12:35-12:37 Matt Turck:你到OpenAI的经历是怎样的?
12:37-14:18 Yann Dubois:说来话长,但我尽量简短。我在瑞士读的本科,专业是生物医学工程。在加拿大的一次交换项目中,我第一次了解到Word2vec。我不确定你是否熟悉那个算法,它基本上是把离散的单词映射到一个向量空间。你可以把它想象成一个平面,含义相近的词被放在更近的位置。它把离散语言转换成一个连续的、语义上有意义的空间。我当时被那个算法彻底震撼了,就在那时我决定要从事自然语言处理(NLP)和语言理解方面的工作。在当时——那是2017年,就在Transformer被引入之前——我错误地认为英语的NLP基本上已经解决了。由于这个原因,我决定专注于数据稀缺的、研究不足的语言。我去了新加坡的Grab工作,在那里我构建了他们的NLP流水线,涉及高棉语、马来语、泰语、越南语以及其他几种语言。跳过一些,我在多个国家做过一些学术工作,最后在斯坦福大学攻读博士学位。在初创公司短暂工作了一段时间后,我最终加入了OpenAI。
14:18-14:29 Matt Turck:是的,我记得在你的博客或个人页面上看到过一个说明,专门告诉量化基金不要联系你,因为你对对冲基金工作不感兴趣。
14:31-14:42 Yann Dubois:我一直认为,考虑我对世界产生的积极影响,或者至少是我试图产生的影响,对我来说非常重要。这就是为什么有那个说明。
14:43-15:06 Matt Turck:是的。就像我们在开始录音前说的,人们可能已经在GPT-5的视频公告中看到你了。你做了一次非常有趣的演示,现场构建了一个应用来教你的伴侣说法语。人们绝对应该去看看。
15:06-15:17 Yann Dubois:没错。那很有趣。GPT-5当时还没有那么可靠,所以我有点紧张它不会成功,但最后它成功了。
15:17-15:24 Matt Turck:那么,那是真正的现场直播吗?我猜那经过了非常非常充分的排练,但它是真正的现场直播吗?
15:24-15:37 Yann Dubois:实际上,就在我们做之前——在最后一次排练时——它没成功。我对此有点紧张,但正式直播时却成功了。
15:37-16:18 Matt Turck:真是没压力啊!不过,效果很好。好了,让我们来解读一下我们在开场白中提到的几件事。我们一开始讨论了推理,我很好奇,2025年或2026年的推理,与我们之前关于o1或o3的讨论相比,有什么不同?特别是,关于GPT-5.5的一个说法——也是我作为用户的体验——是它特别擅长处理混乱的数据。这似乎意味着它需要更多地通过模糊性进行推理。到底发生了什么变化?
16:19-16:35 Yann Dubois:我想说的是,o1和o1-preview在研究社区是真正的突破。它们给了我们能够“思考”的模型,模型思考的时间越长,答案正确的概率就越高。
16:38-17:23 Yann Dubois:这确实是一个突破。最初,如果你看以前的博客文章,你主要会看到数学评估和编程比赛——那些很容易测试模型是否正确的事情。这让你对我们当时如何训练其中一些模型有所了解。我认为去年,尤其是去年底和今年初,我们能够将这些与可验证奖励(我们可以客观地说你正确或不正确)一起工作的算法,应用到混乱的现实世界中。我们现在真正在优化我们为用户提供的实用性,让他们更高效。我认为这才是真正改变的地方。
17:23-17:30 Matt Turck:好的。所以这主要是后训练强化学习部分?
17:30-18:25 Yann Dubois:是的,我认为那是其中的很大一部分。还有另一个主要因素。当你首次开发一个新方法时,它通常是脆弱的、不太可靠的,并且难以投入生产。这方面已经改善了很多。除此之外,我们终于有了一个可以对不同事物进行优化的工具。最初,当我们开发这个工具时,我们对现实世界做了很多简化的假设。现在,我们正在移除这些假设。在后训练中,我们能够优化实际的用户效用,并确保模型对现实世界的任务有用。这也是为什么当前评估看起来更加真实。如果你看看GDPval,甚至像GAIA或SWE-bench Pro这样的东西,它们看起来更加真实。
18:27-18:34 Yann Dubois:它们看起来比我们在o1上看到的Codeforces或编程比赛真实得多。
18:34-18:52 Matt Turck:仍然在推理的话题上,GPT-5.5 Thinking和GPT-5.5 Pro之间最终的区别是什么?仅仅是更多的测试时计算、更多的令牌以及花更多时间来解决问题吗?
18:52-20:10 Yann Dubois:是的,基本上就是这样。问题仅仅在于我们向模型投入多少测试时计算,或者更准确地说,是向我们发布的整个系统投入多少。我们一次又一次地看到,模型思考的时间越长,我们得到的答案就越好。问题是这些缩放曲线绝对不是线性的;存在一个平台效应,并且根据你使用哪种评估,它们看起来有些对数性质。你可以投入两倍的计算量,却只看到很小的性能提升。就个人而言,我不太使用Pro,因为我很没耐心,不喜欢等那么久。我知道它正确的概率提高了,但对我来说,提高的程度不足以证明等待是值得的。然而,有些人确实非常喜欢Pro,尤其是对于学术研究。我知道很多数学家使用它,因为他们可以把它放在后台运行一两个小时。他们不需要快速迭代,而Pro非常适合这些用例。
20:10-20:26 Matt Turck:我很想将这一点与你之前提到的每令牌效率调和起来。想法是模型能够思考更长时间,同时也更高效,从而更好地完成任务?这两个因素是如何相互作用的?
20:28-20:32 Matt Turck:时间和效率方面具体是如何相互作用的?具体来说,当这些因素变化时,模型是如何表现得更好的?
20:32-21:28 Yann Dubois:是的。如果你回到我描述的那个图,x轴代表延迟,y轴代表性能,当我们提高效率时,我们正在将该曲线进一步向左移动。这意味着我们用更少的时间达到相同的性能水平。而“Pro”模型所做的是延伸这条曲线。它说,“我要思考更长时间,但我正确的概率会更高。”然而,Pro模型的每一次迭代也会向左移动,随着时间的推移变得更高效。需要记住的重要一点是,总会有一些任务,你只想最大化正确的概率,而并不真正关心延迟。例如,如果我在睡觉前开始一个任务,模型有八个小时可以工作;它应该尽可能长地思考。这基本上就是Pro模型为你提供的。
21:28-21:42 Matt Turck:用通俗的话说,这实际上意味着什么?它是如何工作的?如果模型开始朝着错误的方向前进,它会更早地中断自己吗?这是它改进的方式之一吗?
21:42-21:46 Yann Dubois:你是在具体问效率在这个上下文中的含义吗?
21:46-22:12 Matt Turck:是的,主要是关于效率。我只是好奇推理是如何变得更强大的。 Yann Dubois:这是一个很好的问题。让我用一个关于人类的比喻来解释。想象一下某个领域的专家,与一个刚入门的本科生相比。对于一个特定的任务,本科生可能需要更长的时间,因为他们需要思考更多的可能性,才能找到正确的方向。
22:15-23:23 Yann Dubois:一个任务可能需要一两天,因为模型必须思考所有可能性并进行调查,特别是如果它以前从未遇到过那个具体问题。相比之下,该领域的专家通常知道应该走哪个方向;他们不会花时间调查十个不同的方向,因为他们知道哪一个最可能是正确的。这就是我们谈论的效率类型。我们本质上是在针对现实世界的问题优化模型。结果,模型被训练成能够以更高的概率识别出哪些推理路径最可能是正确的。除了效率之外,还有你提到的那个点:模型知道它何时在走错误的路径。这是我们可以通过强化学习来训练模型的事情——教会它认识到,“好了,这看起来不像是一条好的路径。让我回溯并测试别的东西。”如果你对模型的训练较少,它可能要到很晚才意识到自己在错误的路径上。
23:24-24:03 Matt Turck:好的,好吧。看起来很多方面都回到了强化学习和后训练。让我们谈谈现代AI系统不同组成部分是如何工作的。我们可以涉及预训练、中期训练和后训练,也许在后训练上多花点时间,因为它非常重要。从高层次开始讲预训练——并且我意识到你可能能或不能讨论GPT-5.5的具体做法——去年的一个大叙事是预训练正在碰壁,不会带来更多进步。这似乎并非如此。
24:06-24:19 Matt Turck:似乎预训练碰壁的想法在2026年根本站不住脚。你能向我们解释一下预训练中正在发生什么,以及为什么它现在以一种人们去年未能预料的方式在进步?
24:19-26:03 Yann Dubois:关于预训练,除了说团队一直在做令人难以置信的工作并且我们的模型一直在变得更好之外,我不能透露太多内部发生的细节。我想强调的一点是,具体关于效率,当你转向更大的模型时,“思考时间”的数量——推理所需的令牌数量——通常会减少。你可以用一个比喻来理解:一个更大的模型在生成特定令牌时,已经在通过其权重进行“思考”。通过增加你正在训练的模型的大小,你实际上可以减少它需要生成的显式思考令牌的数量。通常,通过预训练更大的模型,你能获得更好的整体效率。较大模型的优势在于,在推理时可以更有效地进行并行化。你可能会认为,即使生成更少的令牌,使用更大的模型也会降低系统效率,但这不一定是真的。模型越大,你就有越多的机会来优化GPU推理。最终,这使得整个系统更加高效。这是一个关键点:更大的模型实际上提供了很多效率提升。
26:03-26:10 Yann Dubois:否则,就预训练而言,我觉得这非常有趣。实际上,我大概两年前曾经认为预训练开始碰壁了。
26:13-27:03 Yann Dubois:预训练开始碰壁了。如果你看看Anthropic,例如,他们的模型看起来明显更大,基于每令牌的成本。通常,你可以通过查看定价来判断一个模型是否更大。他们显然仅仅通过增加模型规模就实现了非常高的性能。我认为至少部分领域对此感到惊讶。有很多关于达到“数据墙”的讨论,但看起来我们还没有完全达到。模型越大,在训练期间需要吸收的数据就越多,似乎不同的公司找到了各种方法来克服互联网上数据稀缺的问题。
27:03-27:12 Matt Turck:当前数据的前沿是专注于多模态数据还是合成数据?
27:12-28:11 Yann Dubois:我认为合成数据在数据受限的情况下可以很好地发挥作用。多模态数据也很有趣。我不能透露我们内部在做什么,但我以前曾致力于多模态表示学习。我一直相信拥有大量的多模态数据会显著提高推理能力。我仍然这么认为,但如果你看看Anthropic的模型,它们在多模态方面不一定是最强的,但它们仍然非常聪明。所以,看来这可能不像我以前想的那么绝对必要。然而,我仍然相信一旦我们走向具身AI和代理,模型将学到更多关于世界的知识。通过教模型物理世界如何相互作用,我们很可能会看到通用智能和实用性的提升。
28:13-28:21 Yann Dubois:这就是世界如何与自身相互作用。但看看Anthropic的模型,例如,它们似乎不需要那么多多模态数据就能产生强大的模型。
28:21-28:34 Matt Turck:通过“具身智能”,你是指机器人技术吗?例如,如果你使用一个展示重力如何作用以及机器人如何在空间中移动的视频,假设这将对模型更有用。是这个想法吗?
28:34-29:29 Yann Dubois:是的。我和许多其他人长期以来所持有的直觉是,仅通过文本来理解世界是很困难的。不亲眼看到,很难理解物理学是什么。例如,不看到物体下落,你无法真正理解重力。当你观察我们当前的模型时,它们似乎在没有亲眼看到的情况下理解了重力,但这仍然不完全直观。它们似乎仍然缺少某些常识性方面。我相信通过让模型与现实世界互动,我们将改善模型的常识,但我们离那还很远——我指的是整个学术和AI社区。
29:29-29:42 Matt Turck:是的。既然我们谈到这个话题,作为一个小插曲,这引出了世界模型的概念。暂时摘下你的OpenAI帽子,你看好世界模型吗?
29:42-30:00 Yann Dubois:世界模型是指试图复制或模拟环境的那种吗?是的,但问题在于模拟总是极难构建,并且永远不可能完全真实。
30:01-31:05 Yann Dubois:我认为总需要一定量的训练在现实世界中进行,以确保模型认识到模拟环境与现实之间的不匹配。作为一个领域,我们有一种倾向,即针对某个模拟或不切实际的东西进行优化,甚至超过了有用的程度。我们应该对此保持谨慎;我们花费大量时间和精力优化模拟,这最初很好,但最终,如果你过度优化一些不具现实代表性的东西,你只是出于习惯而已。人们需要意识到何时停止。我不怎么处理这些类型的合成环境,因为我不专注于具身AI,所以我不确定我们是否已经达到了那个点。
31:05-31:18 Matt Turck:好的,很好。回到预训练、中期训练和后训练的流水线——让我们谈谈中期训练。这是一个人们可能较少听到的术语。它到底是什么,为什么它很重要?
31:18-32:00 Yann Dubois:顾名思义,中期训练是介于预训练和后训练之间的阶段。核心思想是,如果你有高质量的数据,这些数据更能代表你期望在最终模型中看到的内容,那么你应该超量训练这些特定数据。退一步来说:预训练基本上是通过在宏观层面消耗整个互联网来试图了解世界的一切。问题是,互联网上的大多数东西实际上并没有那么有用。
32:00-32:44 Yann Dubois:现实是,互联网上的大多数东西实际上并没有那么有用。如果你看看维基百科或GitHub,它们提供编码数据,那里面的信息比某些随机论坛要多得多。互联网上也有很多广告,你可能不想在这些上面训练太多。在预训练中,我们在所有东西上进行训练。在中期训练中,我们基本上给那些我们认为对训练最终模型更有用的高质量数据赋予更高的权重。虽然我不能代表所有人发言,但这肯定发生在学术界和所有开源模型中;他们都有这个中期训练阶段。
32:44-32:52 Matt Turck:很好。现在,让我们进入后训练。让我们从高层次定义它开始。其中有强化学习,但这并不是后训练的全部。还涉及什么?
32:52-33:40 Yann Dubois:这取决于你如何定义这个术语以及你在哪里划定界限。在我看来,采用一个非常宽泛的视角,包括强化学习和我们推理模型的训练,后训练是将一个了解世界一切的东西,转化为对人们有用的东西的过程。我喜欢用来说预训练的比喻是去图书馆。你有关于每个主题的书籍,理论上,你可以在那里找到任何你想要的信息。然而,与一位已经读过这些书的专家交谈要有用得多——你可以向他提问,他能给出答案,并且他实际上理解你在找什么。这基本上就是后训练所实现的。
33:41-34:04 Yann Dubois:在高层次上,目标是创造一种对用户真正有用且更易于交互的东西。这个过程涉及多个阶段。我将重点关注OpenAI专有方法之外的标准阶段。通常,这个过程从SFT开始。 Matt Turck:SFT代表监督微调。
34:06-34:53 Yann Dubois:没错,监督微调。早期,大多数模型主要使用SFT。其思想是,如果你有能够提供期望的最终答案(“黄金”答案)的人类,你基本上可以克隆人类的行为。我们称之为“行为克隆”。问题在于,你永远无法超越你训练数据真实答案的质量。人类在许多方面是有限的,因此模型永远无法超越与之合作的标注人员的表现。
34:54-35:40 Yann Dubois:强化学习阶段超越了行为克隆,专注于优化奖励。这里的理念是:“我不一定知道完美的真实答案是什么,但我可以定义一个答案是否正确以及我希望在其中看到哪些特定元素的标准。”然后你让模型优化这些标准,以最大化其“奖励函数”。这允许模型超越当前人类的能力——或者至少超越与你合作的那些特定人类的能力。这是两个主要阶段。在强化学习本身内部,方法根据所训练的模型而有所不同。
35:42-37:19 Yann Dubois:就模型训练方式而言,至少在开源社区,似乎有不同的方法。首先,有一种带可验证奖励的强化学习。这种情况很容易确定答案是否正确,允许使用二值奖励系统。这又回到了我们之前关于o1和o1-preview的讨论。然后,你有不带可验证奖励的强化学习。在这种情况下,我可能会使用成对比较——比如,一个答案比另一个好——而不一定能定义“完美”答案看起来像什么。当然,这是一个连续统,中间还有其他方法,但这是关于后训练需要记住的三个高层次概念。开源世界的标准方法是先进行监督微调(SFT)。他们克隆从网上或人类那里收集的行为。一旦模型达到了足够高的水平,他们就应用强化学习来推动其超越当前能力。从零开始用强化学习效率极低,因为模型基本上必须偶然找到正确答案。强化学习的工作方式是从你正在训练的模型中采样很多次,识别哪些回答是正确的,哪些是不正确的,然后指示模型生成更多正确的回答。因为你需要命中那个正确解才能学习,你最好先在行为克隆中尽可能接近目标行为,然后再进入强化学习。
37:21-37:29 Matt Turck:强化学习是创造全新的能力,还是仅仅使模型更好地使用其现有能力?
37:29-38:52 Yann Dubois:这是一个很难科学回答的问题。当一个模型在整互联网上预训练时,有人可能会争辩说所有可能的能力都已潜伏其中。然而,如果你看看两年前我们推动的模型——例如,我在开源世界参与开发的Alpaca模型——我们用了大约5万个样本进行监督微调(SFT)。现在,当你看看像Kimi或DeepSeek这样的模型中的强化学习(RL)时,它们似乎使用了接近一百万个数据点。这个行业显著扩大了RL阶段的规模。通过这种扩展,模型显然发展了新的功能能力,比如推理——检查自己答案的能力,尝试改进它们,并为达到更准确的结论而“思考”更长时间。所以,虽然一切在技术上可能在预训练后就已经存在,但过去一年半里,我们确实通过强化学习解锁了更高级的能力。
38:52-39:20 Matt Turck:我几次听到强化学习非常挑剔且难以扩展。在最初的LLM进展曲线中,行业没有大力依赖RL的一部分原因,正是因为让它可靠地工作非常困难。是什么使得扩展RL如此困难?是数据集的问题,识别奖励在哪里,还是完全其他的东西?
39:20-39:24 Yann Dubois:我会说,大多数没有在学术或研究社区从事强化学习工作的人普遍认为它太挑剔,不实用。
39:26-40:06 Yann Dubois:直到大约两年前,学术和研究社区普遍认为强化学习(RL)根本行不通,或者太挑剔以至于不实用。我曾经也是那些人之一。事实上,当ChatGPT刚出来的时候,我还没在OpenAI。我看到他们的博客文章提到他们使用了强化学习,我的第一反应是我可以在没有它的情况下达到同样的结果。我觉得这只是一种过于复杂的方法。这实际上就是我们在Alpaca中开始解决的问题——试图仅通过使用监督微调(SFT)进行行为克隆来重现那些结果。Yann LeCun曾用过一个著名的比喻,说强化学习只是“蛋糕上的樱桃”。我认为这确实捕捉到了当时大多数人的直觉。
40:10-40:36 Yann Dubois:似乎在跨越某个规模之后——当模型拥有“良好的先验”并且基本上了解了世界的一切——强化学习突然开始发挥作用了。这并不仅限于LLM。机器人技术似乎也进入了同样的阶段。研究人员意识到,虽然RL曾经非常挑剔,但当应用于已经拥有全面世界理解的模型时,它实际上学习得很好。
40:38-41:14 Yann Dubois:为了回答你关于什么使得强化学习复杂化的问题,第一个问题是基础设施。从高层次系统角度来看,RL要求你抽样许多不同的答案,并确定哪些是正确的,哪些是不正确的。这个采样过程极其昂贵,而且你必须大规模地进行。目前开源世界正在努力解决的另一个问题是,当我们训练更多的代理模型时会发生什么。
41:16-42:01 Yann Dubois:当我们在训练更多的代理系统时,你只有在非常长的部署结束时才知道自己是否正确。这意味着你每令牌得到的信息非常少,关于你是否在正确的轨道上。这使得信用归属极其困难;很难确定你的整个答案中哪个具体部分导致了成功的结果。从机器学习的角度来看,这是一个重大的挑战。在理想的世界里,我可以这样说:“这个具体动作是好的;多做些这个。”这些代理系统和强化学习的问题在于,直到最后你才真正知道哪些部分有效。这是当前强化学习中的一个主要障碍。
42:01-42:17 Matt Turck:当前强化学习的前沿是什么?似乎有一大堆缩写词,比如GRPO和各种其他技术。你们在使用什么,你对什么感到兴奋,你认为什么最有前景?
42:17-43:09 Yann Dubois:我不能具体讨论我们在OpenAI使用什么,但在开源世界,例如,GRPO似乎效果很好。人们过去使用各种方法,比如PPO和DPO,但社区似乎真的集中到了这一个。GRPO最大的不同在于它利用了我之前提到的简单方法:尽可能多地采样答案,并找出哪一个是正确的。从很多方面来说,GRPO是一个非常简单的方法。总的来说,我们在机器学习中一次又一次地看到,最简单的方法——那个能让你最有效地扩展计算量的方法——通常是最终胜出的方法。这似乎正是这里正在发生的事情,至少在开源社区如此。
43:13-43:27 Matt Turck:我脑海中闪过一个问题——你经常听到AI系统不是被“建造”出来的,而是被“培养”出来的。你会如何描述你的日常工作?其中有多少是科学,又有多少是工艺,即你尝试多种方法,然后只保留效果最好的?
43:27-45:09 Yann Dubois:这是一个很好的问题。我认为它通常始于工艺。人们尝试许多不同的东西,并开始建立一个关于什么有效、什么无效的心理模型。随着时间的推移,我们从那种“工艺领域”转向更科学的方法。然而,纯粹的科学方法很少是最先奏效的。你很少能够采用严格科学的方法,宣布“这是最优的做法”,执行它,然后它就成功了。绝对有一种炼金术的感觉。人们通常对某些东西有很好的直觉并使其成功;然后,他们自己或其他人开始通过非常科学的方法来尝试改进这一点。我想说,这个周期在机器学习中不断重复:先是工艺,然后是科学。两者都非常重要,但它们在流水线的不同阶段出现。就工程而言,那始终是必需的。我会说大多数研究人员已经变得相当擅长——嗯,我不一定说他们都是传统意义上的“好工程师”——但他们已经变得非常擅长在复杂系统内工作,并准确找出他们需要测试什么。随着我们的系统和基础设施变得越来越复杂,所需的工作性质也随着时间发生了改变。
45:11-45:41 Matt Turck:引人入胜。那么,回到强化学习和你一开始提到的一些观点:如果我想让我的模型在计算机使用、代理编码或任何特定领域更好,我是否会专门花时间针对该任务进行强化学习?是否涉及整理专门的数据集,然后设计奖励?是不是这样工作——你只选择一个问题,然后专门针对它应用强化学习?
45:41-47:04 Yann Dubois:需要明确的是,我谈论强化学习更多是因为它是我最了解并且我长时间工作的领域。然而,我们之前讨论过中期训练,所有这些阶段都极其重要。你可以在流水线的不同点改进模型。正如我提到的,你越接近模型的最终阶段,训练规模通常就越小。这允许你快速迭代——以天为单位而不是月为单位。通常,人们从这种快速迭代循环开始,然后深入,对整个栈进行更大的更改。我并不是说只有强化学习重要,但那里通常是人们开始进行更改的地方,然后这些更改才会渗透到栈的更深层。这就是这个过程的工作方式。你在开源世界也看到这一点;后训练的模型数量远远超过新的预训练基础模型。你在那里看到更多的算法改进,这就是为什么我们听到了GRPO、DPO、PPO以及如此多的其他“X-PO”。因为人们可以在最后的阶段非常快速地迭代。
47:05-47:24 Matt Turck:我可以在流水线的最后阶段快速迭代吗?这些模型的“锯齿”特性是否源于这种选择特定问题来解决的方法?这是否使得模型在那些特定任务上表现出色,但在其他领域较弱,还是这仅仅是AI模型普遍的一个基本特征?
47:24-48:21 Yann Dubois:确实有这方面的因素。如果你针对特定类型的问题进行了大量优化,模型当然会在那些环境中表现更好。然而,我的直觉是,这与你正在优化的问题确切是什么关系不大,而与你正在优化的更广泛的问题类别有关。例如,如果一个模型非常擅长数学竞赛,那么它很可能也非常擅长编程竞赛。这不一定是关于特定领域;而是关于底层技能和所需的思维方式——那些执行任务所需的横向能力。通常,当一个模型在某方面表现不佳时,它实际上是在任何领域或语言中都欠缺那种特定技能。所以,你必须考虑这些技能的泛化,而不仅仅是特定领域的能力。
48:21-48:56 Matt Turck:说到泛化,从在数学和编码上取得成功到覆盖不同领域,有明显的演进。这引出了整个“GDPval”概念,即模型在经济各个领域的表现正在被评估。这种进步是整体模型改进的结果,还是刻意的努力——你决定“好了,现在我们要针对经济的这个具体部分,为其构建数据集,进行中期训练和后训练”?那个进步实际上是如何发生的?
49:00-49:05 Matt Turck:这种进步是从那些非常特定的领域开始,然后泛化到世界的其他地方吗?
49:06-50:26 Yann Dubois:这绝对是我们积极推动的事情。我认为我们以及其他公司都在意识到,我们正在走向一个世界,我们想要创造真正有用的产品——提高生产力并帮助人们的日常生活。有一个非常积极的努力来决定我们应该优先考虑哪些领域。既然我们知道我们有可以在不同地方应用的算法,我们的主要限制是收集正确的数据,并找到真正关心某个特定问题的人来研究它。然而,没有那么多具备这样专业知识的人,所以你确实必须排序。这是一种非常主动的方法。总的来说,我会说模型的性能取决于有多少人关心最终输出并积极审查它。如果他们开始更多地关注特定的垂直领域,那些垂直领域会提升得很快。但再次强调,我们能够做这项工作的人数是有限的。
50:27-50:52 Matt Turck:为了展开你刚才提到的一点:模型现在是否泛化得更好,尤其是从强化学习的角度?如果你让一个模型在领域A或领域B上非常擅长,它是否可能使该模型在领域C上也变得更好,无论你在为领域C开发奖励方面投入了多少努力?
50:53-51:03 Yann Dubois:我认为泛化有不同的轴。首先,有算法泛化。这指的是我是否能够将我开发的算法或这种“黑箱”方法应用到其他地方。
51:03-51:27 Yann Dubois:我是否能够将我开发的算法或“黑箱”用于领域A,并将其应用于领域B?看看开源世界,看起来人们确实能够做到这一点。他们采用像GRPO这样的方法,将其应用于许多不同领域,然后它就成功了。这种类型的算法泛化似乎相当强大,这就是为什么我们看到了如此多的进展。如果它不能那样泛化,前进就会困难得多。
51:27-52:14 Yann Dubois:然后是当模型在特定数据集上训练时,模型本身的泛化。我对这个的心理模型是,泛化发生在能力层面。如果底层能力相同,你会看到跨领域的泛化——无论是不同的语言还是编码。例如,你可以优化一个模型使其在C++方面表现卓越,而几乎没有进行特定的C++训练。这是因为预训练模型已经见过所有C++代码,并从根本上理解了该语言的基础知识。
52:14-52:45 Yann Dubois:那种类型的泛化肯定会发生。然而,我认为更难实现的泛化是当我们没有那些横向能力的时候。举一个具体的例子:如果一个模型在“智能”意义上非常强,即在数学或编程比赛中表现出色,我们可能会假设它只是一般聪明。从人类的角度来看,我们认为如果某人在那些复杂任务上很强,那么他就足够聪明去做几乎任何其他事情。但模型并不总是这样。
52:48-54:18 Yann Dubois:一个常见的误解是模型在所有任务上完美泛化,但这真的不是事实。许多人类工作的专业领域极其混乱。编码和数学比赛是定义极其清晰的,但在现实世界中,你需要理解不明确的任务并在模糊性中导航的能力。你必须确定回答一个问题甚至需要哪些资源。在数学比赛中,你需要的一切通常就在提示里——也许五行或十五行文字包含了所有必要信息。在现实世界中,如果我是顾问或在金融领域工作,我得上网查找并提取各种信息,仅仅是为了理解上下文,然后才能开始推理过程。这种类型的横向能力是泛化的基础,但在许多情况下,我们还没有具备这种横向能力。这实际上就是为什么我们在每个领域都能看到幻觉。如果一个模型不擅长承认自己不知道某件事,这种行为通常会在所有方面持续下去。你不会通常发现一个模型在一个领域对其知识校准得非常好,而在另一个领域则完全没校准。
54:18-54:31 Matt Turck:作为一个小插曲,幻觉也是一个强化学习问题吗?你能通过奖励模型在适当时候说“我不知道”来解决它吗?我记得John Schulman有一个关于这个的精彩演讲。
54:32-56:04 Yann Dubois:John Schulman在一两年前做了一个关于这个问题的精彩演讲。他解释说,如果你使用行为克隆——我们之前讨论过的监督微调(SFT)——你实际上最终可能优化出幻觉。具体来说:如果一个模型不知道某篇具体的研究论文,但由人类提供的“黄金”答案中包含了对它的引用,那么你基本上是在训练模型引用它不知道存在的东西。你是在奖励它编造东西。然而,在强化学习中,你首先是从模型自身的分布中采样。模型极不可能采样到它不知道的东西,并且不知何故还是正确的。因此,你永远不会奖励那种行为。相反,当模型采样到它不知道的东西并且答错时,你惩罚并消除那种行为。一般的直觉是,虽然幻觉可以在流水线的SFT部分被引入,但一个强大的强化学习过程应该能防止它们频繁发生。
56:04-56:20 Matt Turck:回到泛化的话题,有没有例子表明,在某个特定领域变得更好实际上使模型在其他领域变得更差?这让我想起有些人数学天赋极高,但其他方面可能不那么出色。
56:22-56:26 Matt Turck:有些人非常擅长数学,而另一些人非常擅长英语。通常,他们不是同一个人跨不同领域。
56:26-58:05 Yann Dubois:通常不是。但会发生的是,你根据你选择优化的领域做出决策。如果你专注于一个领域,你自然会减少对另一个领域的优化。这不一定是改善一件事会使另一件事变差;只是你资源有限。你受限于计算、数据以及涉及该项工作的人力瓶颈。然而,你可能会经历“负泛化”或“负迁移”,特别是模型的横向方面。给你一个非常具体的例子:显式指令遵循与隐式指令遵循。我们经常听说OpenAI的模型非常擅长如果你确切告诉它们你想要什么。但结果,我们也听说如果你不够具体,它们的效果可能较差。例如,如果我说“修改这个文件”,但我在文件名中打错了字,一个极其擅长显式指令遵循的模型会尝试修改错误的文件——那个有错字的文件。而人类则很可能会意识到你犯了一个错误。在那种情况下,显式指令遵循实际上与隐式理解相悖。你会遇到这些横向能力基本上相互冲突的情况。
58:10-58:27 Matt Turck:继续我们关于强化学习的对话,你是否相信当我们从擅长编码和数学发展到处理经济中的其他领域时,那些其他领域会成为可处理的问题?你认为我们最终能在那里达到同样水平的性能吗?
58:27-59:59 Yann Dubois:是的,我相信。我认为我们可以做到。我不认为编码或数学有什么特别之处会阻止我们以同样的方式优化其他领域。然而,有两个主要的注意事项。首先,大多数构建这些模型的人在编码方面都非常熟练,并且他们非常关心它,因为这是他们每天都在使用的工具。没有什么比让开发者也成为最终用户更好的了,因为他们凭直觉就能理解问题。对于像我这样的人来说,如果我自己不理解法律领域,就很难确切知道模型的、比如说,法律方面需要改变什么。第二点,我之前简要提到过,是可验证奖励的概念。有些领域更容易确定一个答案在客观上是否正确。你之前提到了网络能力;我们看到了巨大的改进,因为在网络安全中,验证结果极其容易。如果模型识别出一个漏洞,你可以立即测试它,看看它是否是一个真正的问题。所以,虽然强化学习目前只是更容易应用于某些领域,但我不相信模型的容量本身有什么内在限制会阻止它在其他领域成功。
1:00:02-1:00:19 Yann Dubois:瓶颈不一定在于模型的容量;相反,它在于我们能够约束模型在法律或医学等专业领域执行高水平的能力。简而言之,我们对这些特定领域了解得更少。确实,有些领域比其他领域更容易使用强化学习进行优化。
1:00:19-1:00:30 Matt Turck:很好。让我们花一分钟谈谈评估(或“evals”),因为这是一个非常重要的话题。首先,为什么评估一个模型本身就如此困难?
1:00:30-1:01:01 Yann Dubois:随着模型的改进,评估变得越来越困难。这是因为我们分配给这些模型的任务变得越来越通用和开放。例如,今天我可能会要求模型“为我建一个做某事的网站”。在过去,我可能只是问“这个实现中有一个特定的错误吗?”判断是否存在错误要容易得多,因为我可以让人类专家列出错误,然后自动应用该反馈。
1:01:03-1:01:53 Yann Dubois:判断是否存在错误要容易得多,因为我可以让人类专家列出每一个现有的错误,然后自动应用该反馈。相比之下,评估像网站这样的东西非常困难,因为没有一个“最优”答案;有许多有效的方法来构建一个高质量网站。生成模型的这种开放性质使得评估显著更加困难。另一个问题是,模型在特定领域正在变得比大多数人类更好。因此,我们越来越少的人能够准确评估模型在这些专业领域的性能。这绝对是一个主要的限制。老实说,还有一个文化障碍。大多数人想要改进模型,并认为最好的方法是通过更多的训练。实际上,识别具体问题并确保我们能够准确量化改进同样关键。
1:01:56-1:02:41 Yann Dubois:量化改进的能力与改进本身同样重要——甚至可能更重要。然而,关于这一点一直存在文化差距。在学术界尤其如此,直到大约两年前,评估、基准测试乃至数据集很大程度上都是静态的。大约四年前,出现了一个重大的心态转变,人们意识到数据实际上是关键。现在,有很多人在研究数据,但我认为对评估的关注度还没有完全跟上。每个人都承认它的重要性,但人们并没有完全理解从事“评估”工作能产生多大的影响力。当我刚加入OpenAI时,我的第一个项目就专门侧重于数据和评估。我选择这个是因为我知道这是一个没有得到足够关注的领域,这意味着从事这项工作将会产生难以置信的影响力。潮流终于开始转变了。
1:02:44-1:03:01 Matt Turck:潮流正在转变,但或许还不够快。“模型作为裁判”和AI评估AI的进展是否也同样迅速?这是一个独特的研究领域,还是基本上基于相同的思路和技术?
1:03:01-1:03:26 Yann Dubois:这基本上是相同的方法。我们在评估中所做的大部分工作——尤其是现在我们有了强化学习——几乎可以原封不动地应用于训练阶段。这实际上是评估如此复杂的另一个原因:每次你构建一个评估,你基本上都是在构建生成训练数据集的方法。一旦你有了这个,你就会去优化它。即使你不针对那项具体的评估,你也会使用相同类型的数据进行训练。
1:03:28-1:04:16 Yann Dubois:你会使用相同类型的数据,并且你会表现得异常出色,原因是我之前提到的能力的泛化。模型从一个数据集中学习,变得非常精通于特定的评估,以至于评估本身就迅速变得过时了。这是评估面临的一个重大挑战。回到你的问题,“模型作为裁判”的概念极其重要。它可能是最关键的发展之一,因为随着我们构建更好的模型,我们创造了一个自我强化的循环——一个能力飞轮,其中更优秀的模型成为其他模型的更好老师。这对训练至关重要,但你可以将同样的逻辑应用于评估。我的团队有很大一部分人专注于这个,我相信开发这些“模型作为裁判”模块是绝对关键的。
1:04:21-1:04:49 Matt Turck:好的,太棒了。在我们接近这场对话的尾声时,我很想稍微拉远视角,了解一下你对未来走向的看法。显然,预判AI未来几年的发展极其困难,但让我们看看接下来的12、18或24个月。你觉得事情会继续稳步发展,还是我们正朝着某种感觉更像是不连续性的东西前进?
1:04:49-1:05:07 Yann Dubois:就实际的进步而言,正如我之前所说,我认为它总是连续的。然而,那种不连续性的感觉肯定会发生。我们在三四个月前在编码方面看到了它,我认为我们现在会在每一个其他领域看到它。大多数人还没有充分感受到我们模型的能力和实用性的全部影响。
1:05:08-1:05:48 Yann Dubois:我们看到我们的模型的能力和实用性正在以与当前编码和软件工程演变相同的方式扩展。这种进步肯定会渗透到许多其他垂直领域。在我们已经监测的行业内,就能力提升而言,我认为增长会更连续。我们很少看到巨大的、全局性的不连续性;它们通常是局部性的。当你拉远视角时,轨迹看起来通常相当平滑。虽然这并不总是如此,但大多数时候都是这种模式。我当然无法预测下一个重大不连续性何时会发生。
1:05:48-1:06:02 Matt Turck:你对AI中加速循环的总体概念有什么看法?我想到从持续学习——使模型更加与时俱进并能更快学习——到AI以越来越自动化的方式构建AI这一更广泛的概念。
1:06:05-1:06:09 Matt Turck:关于AI以越来越自动化的方式构建AI这个概念呢?是事实还是虚构?除此之外,你个人对什么感到兴奋?
1:06:09-1:06:55 Yann Dubois:我对持续学习感到极度兴奋。我认为我们还没有完全攻克它。我们有像Codex记忆这样的东西,这很有帮助,但这肯定不是最终状态。我有一个朋友经常谈论我们应该关注的一种特定图表:x轴是时间,y轴是模型为用户提供的实用性或有用性。现在,如果你在零天把一个模型放到一家公司里,你可以说它比大多数新员工更有用;它在T0时起点更高。然而,随着时间的推移,它的实用性基本保持不变,因为它并没有真正学习特定公司的知识或适应。
01:06:57-01:07:32 Yann Dubois:模型还没有真正学习公司特有的知识,也不会在执行的任务上随时间变得更高效。相比之下,人类学习得非常快。重要的是“曲线下的面积”——随时间累积的学习量。因此,在许多场景下,人类仍然更有用。为了弥合这一差距,我们需要解决持续学习问题。我们需要使那条学习曲线随时间单调递增,确保模型在特定环境中运行的时间越长,它们就变得越有用。
01:07:32-01:07:47 Yann Dubois:我对这一前沿领域感到极度兴奋,尽管我实际上很惊讶我们还没有取得更大进展。三年前,当ChatGPT首次推出时,我和一些朋友在做一个创业公司。我们当时考虑专注于持续学习、个性化和一般的记忆。当时,我们认为OpenAI会很快解决这个问题,因为他们有数据、用户和模型。
1:07:48-1:08:06 Matt Turck:拿记忆来说。我们都认为,“OpenAI会在接下来的六个月内解决这个问题。他们拥有所有的数据,拥有用户,模型会从这些互动中学习得难以置信地快。”然而,三年后,我不认为我们已经达到那个目标。用外行的话来说,根本困难是什么?
1:08:06-1:08:36 Yann Dubois:这是个好问题。老实跟你说,我不太清楚为什么我们花了这么长时间才弄清楚。这是一个我相信如果我们真的投入足够的资源,我们就能解决的领域。当然,特别是当你在企业环境中谈论记忆时,你会遇到关于权限和隐私的主要障碍——具体来说,哪些信息可以共享,哪些信息不能跨不同边界访问。
1:08:38-1:08:50 Yann Dubois:即使对于单个用户,我们也没有完全做到。我不完全理解为什么——至少在我可以讨论的高层面上——但我们还没有解决它。
1:08:50-1:09:32 Matt Turck:你提出的这一点对AI构建者、投资者和初创公司来说真的很有趣。它涉及模型在企业环境中变得越来越智能的问题。在模型的核心能力与人们围绕它们构建的基础设施之间存在一种张力。一两年前,每个人都关注RAG(检索增强生成);如今,都是关于代理框架。很多人都在想,模型最终是否会“吃掉”这个框架,使那些外部解决方案变得临时。从你的角度来看,你觉得这将如何发展?
1:09:35-1:10:26 Matt Turck:你认为这趋势是向什么方向发展? Yann Dubois:我认为代理框架现在可以显著提高模型的能力。然而,考虑到我们在核心模型能力方面看到的快速进步,我个人不会过于依赖这个框架,除非它是为了一个非常具体、直接的目标。对于专注于特定垂直领域的公司来说,他们可能想要从80%的可靠性提升到85%。一个框架可以提供那种额外的提升,这非常重要。但他们需要带着这样的理解来构建它:随着底层模型的演变,他们将来必须重新调整那个框架,这完全没问题。然而,如果你试图构建一个通用框架,那就是另一回事了。
1:10:28-1:11:20 Yann Dubois:我不相信一个通用框架能够长期持续。为特定领域构建框架是一种必要的短期策略,你总能用它们做更多的事情。事实上,我认为如果你有一个特定的问题,每个人都应该更多地这样做,因为由于没有好的框架,我们留下了太多潜力没有开发。可以说,如果我们现在冻结当前的模型,并完全专注于完善框架——甚至花更多时间专门用一个好的框架进行训练——人们会已经在每个领域感受到AGI的影响。然而,由于我们不会停止开发,并将继续训练越来越好的模型,我们还没有完全理解框架的最终版本会是什么样子。
1:11:21-1:12:10 Matt Turck:最终的框架在不断演变;它总是会变化。关于应用,我有一个类似的问题。我们提到了你在不同垂直领域的进展,特别是通过GDPval,以及你如何对电信行业进行了基准测试,这涉及复杂的客户服务工作流。你也展示了金融代理的进展,自动化了88.5%的内部投资银行建模任务和51.1%的Office QA Pro任务。你一点一点地攻克了越来越多的这些领域。你认为人们是否仍然应该构建特定的应用程序,还是随着我们越来越接近AGI,所有这些最终都会成为模型核心能力的一部分?
1:12:10-1:12:21 Yann Dubois:外部公司和初创公司仍然有巨大的空间可以进入特定的垂直领域。我相信这里面有很大的空间,因为很多人认为原始模型能力是主要瓶颈,但实际上瓶颈往往是最后一英里。
1:12:23-1:13:15 Yann Dubois:很多人认为带引号的“智能”或原始能力是真正的瓶颈,但我认为这不是事实。大多数时候,瓶颈是“最后一英里”。这关乎确保模型拥有正确的权限、正确的连接器以及诸如此类的事情。在OpenAI,我们将非常专注于这种一般的、横向的方面。我认为其他公司应该更多地关注垂直领域,从我们目前所拥有的东西中提供最大的价值。在不同的行业中,这最后一英里总会留有足够的空间。我强烈鼓励大家继续在这方面努力。也许有一天我们会停止横向进步,但我认为短期内不会。
1:13:18-1:13:22 Yann Dubois:我不认为这会在短期内发生。我们最终可能会开始关注它,但这不是我们现在正在做的事情。
1:13:22-1:13:34 Matt Turck:好的,嗯,这听起来是一个结束的非常乐观的注脚,至少对初创生态系统来说是这样。非常感谢你,Yann。这太棒了;我真的很喜欢。感谢你抽出时间与我们交流。
1:13:34-1:13:36 Yann Dubois:很好。谢谢你,Matt。
1:13:36-1:13:55 Matt Turck:嗨,我是Matt Turck。感谢收听本期MAD播客。如果你喜欢它,如果你还没有订阅,我们希望你能考虑订阅,或者在你在观看或收听的任何平台上留下一个好评或评论。这确实有助于我们建设播客并吸引优秀的嘉宾。谢谢,我们下期节目见。
制作方:Transcript Desk Chrome扩展
🔗 原文链接
https://thetranscriptdesk.substack.com/p/openais-yann-dubois-why-ai-progress