我们距离RSI还有多远?来自AI一线的观点

 我们距离RSI还有多远?来自AI一线的观点

张雅琦


来自OpenAI等机构的三位AI一线专家认为,AI研究员10倍提效及全能白领有望在1-2年内实现,而超越人类顶尖专家的ASI或需3-5年。然而,当前模型在自主设定目标、克服灾难性遗忘以及架构瓶颈等方面的挑战,仍是通往RSI的深层阻碍。
AI递归自我改进(RSI)的时间表,正成为业界最具争议的核心命题。

在播客主持人Dwarkesh Patel与三位AI研究者的深度对谈中,OpenAI联合创始人、现Thinking Machines首席科学家John Schulman预判:距离AI在所有可在计算机上完成的认知工作中全面超越顶尖人类专家,可能只需3至4年。与此同时,三人一致认为,在AI研究者生产力提升方面,两年内实现10倍效率提升具有相当的可信度。

然而,通往RSI的道路并非坦途。对话揭示出一个核心矛盾:当前AI体系在"做什么"方面已接近人类水平,但在"决定做什么"这一更高层次的目标设定能力上,仍面临根本性挑战。三位研究者的判断在多个关键问题上出现分歧,反映出这一领域深层的不确定性。

RSI的技术瓶颈在哪里
参与对话的三位研究者分别是:John Schulman、Zyphra首席技术官Beren Millidge,以及模型训练平台Baseten模型训练负责人Charlie O'Neill。

在被问及2036年若未出现"超级智能大爆炸"最可能的原因时,三人给出了不同侧重的答案。

Beren Millidge将其归结为"类莫拉维克悖论"的延续——AI可能在所有基准测试上表现卓越,但始终存在某种难以跨越的"仿真到现实的鸿沟"(sim-to-real gap),使其无法真正渗透现实世界。John Schulman则指向一个反复出现的周期:新模型发布时令人震撼,但使用一段时间后又开始"显得迟钝"。他认为,这一循环可能比预期重复更多次,因为模型在研究和工程领域仍受制于自身判断力的不足。

Charlie O'Neill提出了更深层的架构问题:当前以Transformer加强化学习为核心的范式,距离理论上"芯片可承载的最优学习者"究竟有多远?他以摩尔定律类比——这条增长曲线看似平滑,背后实则依赖无数离散的技术突破。如果AI想变得更聪明,光靠现有的技术路径(比如现有的大语言模型)已经不够了,必须发明出全新的底层技术;但尴尬的是,现有的AI可能根本没这个本事帮我们把新技术发出来,结果导致AI的发展直接撞上天花板、停滞不前。

人类最后的护城河
John Schulman认为,即便AI承担全部技术工作,定义"我们到底想要什么"将是人类最后坚守的阵地。他将这一能力称为对齐(alignment)的第一要素——"目标规格化",即确定正确目标应是什么,而非仅仅实现一个已给定的目标。"后训练团队需要大量人员,根本原因是模型在无数场景下的行为方式必须由人来判断。"

Charlie O'Neill进一步区分了两类研究:一类是目标清晰、可量化优化的"自动化研究";另一类是推动范式转变所需的"开放式科学"——在这类研究中,目标本身无法被预先指定。他以GPT的诞生为例:从DeepMind"通过游戏解决智能问题"的路径,到Alec Radford选择"预测大规模文本的下一个token",这一跳跃并非优化的产物,而是人类直觉的闪现。AI系统能否复现这类跳跃,目前没有人有答案。

Beren Millidge将这一问题提炼为RSI的核心挑战:"要让AI进入自驱动循环,它必须能提出目标、优化目标、判断结果,再提出新目标,并且这一循环长期不脱轨。"他警告,这或许是另一个版本的莫拉维克悖论——对人类而言最自然的自主性,对AI而言可能恰恰最难复制。

持续学习:模型能否从部署中进化
对话中一个反复被追问的问题,是推理计算是否应当反哺模型训练。Charlie O'Neill以Cursor的Composer为例,描述了一种更实时的闭环:模型每五小时评估一次在内部基准上的表现,若有改善则部署,若没有则丢弃该版本。

然而,当这一循环被放大到微观层面——针对单一企业、单一任务持续进行小批量更新时,问题便接踵而至。Charlie O'Neill指出,无论是监督微调(SFT)还是在线策略蒸馏,在迭代到数百次微更新后都会出现"灾难性遗忘"——模型开始丧失更早习得的通用能力。RL(强化学习,Reinforcement Learning)更新对模型权重的改动幅度极小,在保留通用能力方面表现更优,但正因如此,它能注入的新知识也十分有限。

Beren Millidge将问题归结为塑性(plasticity)与稳定性的根本张力:"如果你无限期地在同一个基模型上持续训练,它会在某个点渐近饱和。这就是为什么人们最终还是要重新训练新的基模型。"三人预计,这一循环将随时间加速:从每三个月发布一次新模型,到每周、每天,乃至每小时——届时,连续学习的问题才算真正得到解决。

强化学习为何奏效:超出预期的原因
在对话的技术核心部分,三人尝试解释强化学习为何比一年前业界的普遍预期更为有效。

Beren Millidge将答案分解为两个层面。首先是被严重低估的中间训练阶段(mid-training)——大量合成推理数据的注入,已将模型推进至最终强化学习检查点80%的位置。强化学习本身做的,是在这个高质量起点上进行策略微调,而非从零开始习得行为。更关键的是信噪比问题:SFT要求模型精确匹配训练数据中每一个推理token,大量"噪声比特"淹没了真正重要的信号;而RL只传递"答对了还是答错了"这一比特,使有效信号获得极大的放大。

Charlie O'Neill则以"量子相变"类比预训练的平滑损失曲线背后隐藏的离散跳跃。他认为强化学习同样如此:在单个任务上,模型可能经历从0.5%到90%通过率的相变,但当数十个任务的相变被平均,加之"时间跨度泛化"(horizon generalization)效应,便呈现为宏观层面的持续进步。

John Schulman则指出RL带来能力的同时也带来了多样性损耗——经过RL训练的模型会反复使用相同的叙事主题和人物名称,创意写作的分布宽度明显收窄。更值得警惕的是,由于大量开源模型都在蒸馏Claude,"所有开源权重模型都写得像Claude,有着相同的语言习惯",这种"单一文化的涌现"令他感到担忧。

时间线预测:从远程工作者到ASI
对话最后,三位研究者给出了一组快速预测。

实现全能白领远程工作者(能在一个月内无缝执行复杂项目、与他人协作的AI):Charlie O'Neill预计约一年,前提是任务环境有良好的程序化接口;若依赖浏览器操作,则约两年。Beren Millidge给出三年,理由是真实工作中仍存在大量零散的长尾任务。John Schulman认为大致一年内会出现可用版本,但"能做某些事很好,另一些事不那么好"。

AI研究者实现10倍生产力提升:John Schulman给出两年,Beren Millidge表示认同;Charlie O'Neill则认为需要5至10年——他的核心顾虑在于,自己消化信息、做出贝叶斯最优实验决策的能力,是真正的瓶颈所在。

实现全域认知工作超越顶尖人类专家(即ASI):John Schulman给出3至4年,认为AI研究是"对AI而言相对不那么难的任务,因为涉及大量代码数学";Charlie O'Neill则说5至10年,并明确表示"自动化AI研究基本等价于ASI"——因为世界上太多任务需要持续学习和超长上下文整合,而这些能力目前仍是系统性短板;Beren Millidge认同5年区间,但提醒将存在大量"AI理论上能学但没人分配算力"的长尾领域,这些领域的突破将延迟更久。

以下为访谈内容全文,部分有删减:

Dwarkesh Patel:

今天,我和三位AI研究员朋友聊天,每次和他们交谈我都能学到很多。他们恰好也在一些相对开放的研究机构和公司工作,所以你们可以公开谈论一些事情。和我一起的是 Beren Millidge,他是 Zyphra 的CTO,该公司正在开发开源模型。John Schulman 是 Thinking Machines 的首席科学家,此前是 OpenAI 的联合创始人,并领导了催生 ChatGPT 的 RLHF 工作。还有 Charlie O'Neill,他是 Baseten 的模型训练负责人。

我的第一个问题是:如果到了2036年,我们并没有成千上万个疯狂的超级智能在到处运行、彻底改变世界,最可能的原因是什么?排除外生的政治冲击、战争,或者他们禁止AI之类的因素。从技术角度来说,2036年没有变成疯狂的异形超级智能世界,最可能的原因是什么?

Beren Millidge:

有一个经典的现象,几乎像莫拉维克悖论一样,我们认为AI“如果它能做这个,那就会非常了不起”。如果它能解决这些困难的数学问题,如果它能赢得国际象棋等等……然后它解决了这些东西,却没有那么大的影响力。显然,它有一定的影响力,但不是一切。

如果这种情况 somehow 持续下去,始终没有出现真正的泛化火花,我认为这可能导致AI在人们放入基准测试或环境中的一切任务上都极其擅长。但仍然存在某种持续的“仿真到现实”鸿沟,不知怎么地阻碍了一切。我认为这不太可能。实际上,我们已经在实践中看到了RL带来的这种泛化。但如果元学习的泛化真的难到荒谬,加上我们没有解决持续学习问题,而且这就是超级困难、不可能……那这将是我在这种情况下默认的场景。

John Schulman:

我同意这一点。人类现在相对于模型有很多优势。每次新模型出来,它会在某些领域追赶上来。但你最终会被模型较弱的环节所瓶颈,比如判断力较差的地方,或者模型无法足够好地自我检查。

有一个不断重复的循环:新模型出来,人们惊叹不已,说“这就是了。这就是AGI。”但用了一个月左右之后,它就开始显得笨了。这个循环可能就这样一直重复下去。很难预测它会重复多少次。

现在,你没有得到能力的爆炸式增长,因为你在尝试做研究和工程时仍然会被足够多地瓶颈住。即使模型能写的代码比人多得多,它也不会让你生产力提高100倍。所以也许这种循环比我们预期的要多。

Charlie O'Neill:

对我来说,问题在于“你可以在芯片上拥有的学习器”的全局最优解与 transformer + RL——基本上是当前的配方——之间有多大差距。人们想象,一旦你有一个在所有AI研究上都比所有人类都好的智能体,即使它只比所有人类好0.1%,那么你可以并行运行数十万甚至数百万个这样的智能体——而且随着芯片速度提升,你可以运行得快得多——这将压倒所有其他瓶颈。你最终会在自我改进方面达到非常快速的起飞。

我可以想象,如果我们继续沿着当前范式——基本上是自注意力、RL、扩大RL环境——的轨迹前进……想想摩尔定律发生了什么。我们有一条非常好的直线,持续了非常非常长的时间。但为了保持那条缩放定律,必须发生许多离散的不连续性和创新。LLM也发生了同样的事情。我们有预训练缩放定律,然后它遇到了收益递减。然后我们想出了RL并解决了那个问题,然后我们又得到了一条新的收益递减曲线,让它看起来像一条直线向上延伸。

所以,如果它需要另一个这样的不连续性来解决,我不确定当前用这些RL环境训练LLM的方法——即使是针对RSI的RL环境——是否能够发现那个不连续性。如果不能,我们可能会撞上一条渐近曲线。

Dwarkesh Patel:

但你认为这个不连续性会比2012年以来的任何事情都更难吗?

Charlie O'Neill:

如果我们知道那个答案,我们差不多就有能力实现它了。但也许我们应该区分:一个是添加到当前范式中的不连续性,它是累积的——有一些超越RL的东西我们必须发现,也许它们能够在那条直线上连接各个点——或者,还是那个问题,我们离全局最优解有多远?我们是否必须回头抛弃梯度下降和神经网络本身?我不认为,如果你继续扩大当前范式,一个LLM,无论你运行多少个LLM,如果差距太远,它一定能够发现那个不连续性。

Dwarkesh Patel:

唯一的希望真的是深度学习无法把我们带到至少能够主导人类研究和人类开发的AI,包括人类提出新范式等能力。或者,我不知道,也许人类也永远不会发现下一个学习架构。但就人类最终可能发现它而言……但看起来……如果你只看2012年至今的进展,然后继续下去——我知道这只是由大量计算扩展等推动的——如果它没有达到至少在研发领域主导人类的地步,那会很奇怪,尤其是在未来几年。

Ryan Greenblatt 最近上了播客。他提出了一个观点,我很好奇想听听你们的想法。你可以想象,随着AI变得越来越有能力,它们能够在模拟中取得进展,这些模拟激励它们不仅在AI研发上变得更好,而且在一般科学上也是如此。这是所有实验室都在瞄准的目标,许多初创公司也在瞄准。

另一个直觉泵是,如果你看自80年代以来国际象棋机器人的Elo分数。Elo随时间非常线性地增长。但当它们越过人类范围时,有一个巨大的不连续性,从人类专家总是赢AI,到人类专家永远赢不了AI,而Elo线性增长。

我同意你的观点,到目前为止,AI能力在世界上的最终经济影响并没有那么大。但那是因为它们相对于人类的Elo在缓慢上升。

Beren Millidge:

我同意这会很令人惊讶。这不发生的唯一方式是,正如你所说,它在某个点之前渐近地趋于平缓。因为在我看来,我们已经非常接近开始越过人类Elo分数的点了。所以我们需要在那之前渐近。这是在你提出的这个场景中——不知怎么地我们在2035年坐在这里,一切都正常——这发生的唯一方式。我认为另一种方式是AI受到戏剧性的监管。实际上,这在我看来是这个场景发生的最可能方式,而不是技术原因。

Charlie O'Neill:

我认为有不同类型的研究。有一种自动研究风格的研究,目标已经被非常清晰地指定,你在优化那个目标。我认为每个人都在想象,如果我们继续沿着让预训练损失下降、让我们的环境奖励上升的路径前进,那将带来改进。

但也许Ryan所谈论的是这种更加开放式的科学,它是范式转变所必需的,我们无法指定目标,AI也绝对无法指定那个目标。我们必须非常非常小心地为这些事情指定目标。

Dwarkesh Patel:

也许你的观点是,2012年以来发生的突破的本质是,我们发现了……2012年,人们并没有说……我假设,我不知道,你们当时在场。至少John,你当时在。但我没有。

Charlie O'Neill:

我当时在上小学。

Dwarkesh Patel:

实际上,John,我很好奇你的“岁月智慧”,或者说是“在战壕里”的智慧。想必,一个重大突破是意识到下一词预测是……你不会想到2014年nanoGPT speedrun是要优化的东西。但现在我们已经来到这个新范式,你会想到在那上面做speedrun,让AI变得非常擅长那个。

但也许有下一个需要优化的内循环,AI不会预见到。有一个收入的外循环或者其他什么,最终应该很强,但它是一个非常慢的外循环。

John Schulman:

事实上,我记得在OpenAI早期,有种直觉认为仅仅最小化对数损失不会让你达到智能。因为重要的部分在损失中占比如此之小,以至于会被噪声淹没。所以仅仅在下一词预测上训练语言模型不会学到你想让它学到的有趣东西。我们需要设计更好的目标,更加强调重要的东西。

你可以为此提出各种论据。你可以说,“哦,人类可能不会学习为环境中的一切建模。大多数人无法对他们看过的某个场景进行照片级逼真的再现。所以我们一定需要更好的目标。”但后来事实证明它就是能行。

Dwarkesh Patel:

正如你指出的,即使在当前的AI研究中,后训练基准的内循环也不一定转化为用户喜欢的东西。

John Schulman:

哦,是的。整个领域非常依赖泛化,很难预测你什么时候会得到泛化,或者你什么时候会得到某种分布外泛化。我们知道,如果你在你关心的任务上训练,你会做得更好。但最重要的进步往往是那些我们根本没有理由期待的泛化类型。

例如,仅仅在这个非常朴素的下一词预测目标上预训练,就能泛化到各种需要以某种深层方式理解输入的任务,或者从预训练中学习某种非常罕见且代表性不足的技能。然后还有从可验证任务到不太可验证任务的泛化,这也是一种先验上没有理由期待的泛化。

Dwarkesh Patel:

这是一个有趣的问题,因为一个直觉泵可以解释为什么你会看到某种奇点非常迅速地出现——甚至不用扩大AI进步的输入,不仅仅是AI劳动力——那就是在你运行每一个七位数的实验之前,你在AI劳动力上花费了等量的计算。所以你有了你们这些人的自动化版本,花一个世纪思考什么是最优实验,做小规模消融,发展出 literally 一个世纪的理论,甚至可以追溯到深度学习之前。

在你决定运行什么实验之前,你在做极其最优的实验设置。然后实验结束后,你花一个世纪思考发生了什么,以及下一个要运行的实验是什么。

John Schulman:

如果你足够努力地思考,你很可能事先就能预料到其中一些事情。可能存在某种非常聪明的方法来做小规模实验,让你建立理论,然后泛化到大规模实验。所以我预计我们远未达到研究能做到多好的天花板。

我可以想象一个未来,AI做大量的分析和理论构建,花费与实验本身相当的计算,做各种分析并围绕我们目前所看到的东西建立理论。

Charlie O'Neill:

我认为当目标被明确定义时,有非常具体的例子。所有思考能做的就是根据你形成先验后获得的比特来更新你的后验。你无法仅仅通过思考获得任何新比特。但当目标被明确定义,且有数据摆在那里时,我想在当前范式中会有很大的加速。

一个很好的例子是,如果你让AI思考Kaplan缩放定律。此时AI会注意到,“哦,他们只是取了这些中间检查点,没有考虑退火,所以这是错的。”那会在几年前就被抓住。我们会因为AI的那个观察而缩短一到两年的进展。

再次,一旦目标被明确定义,也就是更低的预训练损失或其他什么,有很多很多好例子表明,如果你多思考一下,你就能显著减少你已经做过的事情。比如muP,以及学习率如何随模型规模缩放,并意识到模型宽度在其中也很重要。我觉得你真的可以倒推出很多这些东西,砍掉很多低垂的果实。如果我们的目标只是“最大化我们当前的目标”,我会想象有10倍的加速。

但我不认为这能泛化到一开始就提出正确的目标。仅仅思考不一定能给你正确的目标。

Beren Millidge:

我认为这对任何来自当前AI的非常快速的RSI来说都是关键问题。AI能多好地泛化到学习它们自己的目标?要有任何自我推动的自动化循环,我们需要AI提出目标、优化它们、搞清楚,提出新目标,并让这在很长很长时间内任何时候都不失控。

回到莫拉维克悖论,可能存在一种莫拉维克悖论的情况,我们认为这种自主性和自我封装——我们可以自己想我们应该做什么,然后去做,并有这个循环——是超级容易的,因为我们总是这样做。显然,进化需要创造出能够长时间独立生存的生物。而这可能只是AI出于某种原因真的很难做到的事情,就像运动 stuff 真的很难但数学超级容易,尽管数学对我们来说超级难。

Dwarkesh Patel:

但时间跨度增加不是表明——

Beren Millidge:

是的,没错。这是另一种可能性,但我同意,没有明显的证据支持这一点。事实上,我们的智能体现在超级持久,做这件事相当容易,这算是反对这一点的证据。但如果这很难,这可能是我们没有得到这种立即起飞的原因之一。

Dwarkesh Patel:

如果你回顾2012年到现在——或者也许从你开始做研究到现在——自那时以来发生的所有创新中,包括纯工程的、纯概念的,哪一件看起来是人类在AI完全自动化AI研发之前最后必须做的事情?

Beren Millidge:

可能只是迭代地提出正确的问题。如果你能让AI做任何实验,你仍然需要决定做什么实验。现在我认为AI在这方面与编写实验代码相比还不太擅长。每当我们谈论研究时,它们提出一堆杂七杂八的东西,都是非常非常小的步骤。

Charlie O'Neill:

甚至从DeepMind的方法——“我们将通过学习以超人类水平玩游戏来解决智能”——到像Radford这样的一个随机研究员——“我将尝试预测非常广泛的数据的下一词”……即使Radford发现了这一点,人们也花了一段时间才决定扩大规模,因为我们必须提出缩放定律的想法,以及你可以非常可靠地预测这些事情的事实。

John Schulman:

我想说,人类最后的工作,或者说人类角色中持续最久的,是定义目标和决定我们真正想要什么。在这方面,比如决定AI助手应该如何行为,或者什么是有帮助的,或者当我们做RLHF时目标是什么,就是这样的事情。然后后来,定义宪法和模型规范是另一件事。即使AI能做所有技术工作,我们仍然需要做很多这样的事情,决定我们真正想要什么。

Dwarkesh Patel:

对齐是最后的工作。

John Schulman:

对齐算是答案。但对齐本身可以分解为目标规范,或者说搞清楚正确的目标应该是什么,然后实际实现或优化你定义的目标。我认为第一个在短期内不会消失。

如果我想到一个后训练团队,为什么需要很多人在团队里,就是因为有很多不同的领域你需要弄清楚模型应该如何行为。很难把整个事情自动化,因为必须有人思考模型在这个领域应该如何行为。

00:28:06 – 自动化的AI研究员将如何训练

Dwarkesh Patel:

我还有一个问题是,第一批能够自动化AI研发的模型实际上将如何训练。有一个玩具版本,就是Ryan所说的。你只是让GPT-8尝试构建GPT-3大小的模型,这些模型非常擅长内循环类型的挑战:击败需要持续学习的视频游戏,或者用最少的计算达到某个损失,等等。

但John,我认为你有一个有趣的观点,也许这不是实际发生的方式。所以我很好奇,到了你实际有能够自动化AI研发的AI的时候,它们可能是如何训练的?

John Schulman:

我们可能会做一些组合:从人类反馈中学习以吸收研究员的品味,以及创建大量涉及做多步研究项目的练习环境。人们实际上会做这两件事的某种组合,每次迭代修补上一次迭代中看起来最糟糕的东西。研究员会大量使用AI,并注意到它们有一些一致的弱点。这些东西要么通过收集人类反馈来修补,要么通过创建环境来修补。

Charlie O'Neill:

也许一个有用的思考方式是,我们回滚多少传承,然后从那里让自我对弈。在极限情况下,你想象只是给它们一个GPU,也许还有神经网络什么的,然后说,“好吧,弄清楚如何训练一个模型来做这些特定任务。”目前的工作方式是,我们一直走到传承的最边缘,说,“好吧,这里是Anthropic在过去几个月在他们的训练堆栈中发现的bug。我们会把这些变成环境。”你需要训练并在前沿上变得更好。所以你显然锁定了之前传承的所有历史。

但你可以想象一个世界,你回滚到GRPO之前之类的。然后你有环境试图让它发现RL模型的最佳形式,然后也许你回滚得越来越远……但我认为我们仍然会被计算瓶颈住,人们只会继续待在前沿,基本上把自上次模型版本以来发现的bug和任何改进变成训练环境。

Dwarkesh Patel:

这对在模型代际之间拥有非陈旧的新数据也非常好。再次,这基本上是AI实验室内的持续学习,通过环境和RLHF类型的东西将过去三个月的AI研究进展蒸馏回模型本身。

Charlie O'Neill:

而且这是蒸馏。这可能就是为什么我们中一些人觉得它是渐近的。你总是只是试图获取过去三个月的进展。那个进展当然是由AI贡献的,但它也仍然有人类在循环中。感觉你只是在不断地越来越接近人类研究员正在发现和能够做的事情。

Beren Millidge:

不过我要说的一件事是,显然如果你只是在轨迹上蒸馏,你永远无法超越它。但环境可以远远超越人类能做的。设计一个人类无法解决但AI显然仍然可以尝试解决的环境非常容易。那将是超越人类AI研究所能做的路径。

Charlie O'Neill:

你有关于RSI的例子吗,什么样的训练集?

Dwarkesh Patel:

Nanochat speedrun,但比人类speedrunner更快。

Beren Millidge:

我觉得特别是在AI研究中,定义目标非常容易。你可以说损失需要是1.3之类的,现在没有人类能做到。但这是一个极其可衡量、可验证的任务。如果AI做到了,那就太好了。

Dwarkesh Patel:

或者我不知道,构建一个1亿参数的模型击败Minecraft。那可能太容易了,但击败一个更复杂的游戏之类的。

Charlie O'Neill:

1亿参数的模型击败Minecraft,这不是很疯狂吗?我们称之为太容易了?想象一下如果你五年前这么说。

John Schulman:

我想说很多研究并不完全是这样,不是在一个明确定义的目标上爬山。更像是,我们有一个关于模型应该更好的某种方式的直觉。我们也有一些似乎朝这个方向走一点的算法的想法。所以让我们想出一个任务,旨在展示这种方法的生命迹象,看看我们是否得到那些生命迹象。如果我们得到了,我们可以制作越来越现实的任务版本。

Dwarkesh Patel:

它更多是由直觉引导的。内循环是测试那个直觉,而不是测试本身导致洞察。

John Schulman:

对。你不是直接优化你最终关心的目标或实际生产目标。你稍微放松你的目标。你说,“让我们在现实性轴上稍微放松一点,找到一些实际有效的方法,然后在方法成熟一点后再回到现实性。”

还有更偏向解释和发展理论的研究。通常我们在机器学习中没有那么有预测性的数学理论。但我们有很多关于正在发生的事情的更非正式的理论。

Beren Millidge:

想必模型会在所有这些任务的某种组合上训练。有些非常容易验证,有些是LLM作为裁判,或者只是问人类,“这看起来合理吗?”希望这些都能泛化到这些更难、更模糊、更朦胧的任务。它可能在一定程度上会。它是否能泛化到足以让循环变得自我封闭、完全不需要人类在循环中,还不清楚。

00:33:51 – 长视界RL会引出AGI吗?

Dwarkesh Patel:

也许退一步。这似乎是我对AI研究未来计划的理解。你告诉我你是否认为它会成功,或者你是否同意这个描述。赌注是,我们将在数百万个多样化环境、数百种不同领域中扩大RLVR训练。在另一端出现的是一个智能体,它学会了这些基本技能——或者低于基本技能——关于坚持、能够分类信息和上下文,最终端到端优化与其他智能体合作等。这样的智能体在上下文中将非常样本高效——你做了关于如何扩大上下文学习使其任意长的研究,但你继续扩大。最终出来的东西基本上像一个可以连续工作一周或一个月的即插即用远程工作者。

首先,你同意这是实验室正在下的赌注吗?其次,这足够吗?基本上学习如何在数据中心内的这些模拟中学习,然后部署到现实世界,但实际上不从现实世界部署中学习……只从数据中心模拟环境中学习这些元技能。

Charlie O'Neill:

我认为现在很难区分实验室的努力有多少用于直接的RSI, versus 制造他们可以继续部署以收集收入来资助下一次大训练运行的通用智能模型。

对于后者,是的,那可能只是他们正在下的赌注。非常清楚,这些环境在过去几年中的走向模式。Anthropic的环境传承是一个很清晰的例子。首先,我们只关注编程,我们会变得非常非常擅长那个。然后,从编程中获得的任务视界——这可能是最容易获得的数据,可以创建环境,以及他们自己的内部东西可以变成环境——然后我们要泛化。

我们要接下来做金融,在RL训练中 literally 有那么多Excel数据和所有那些东西。然后是PowerPoint。这是工作经济的长尾。那似乎非常有效。很多其他实验室,甚至开源实验室,现在已经意识到那是正确的赌注。

Dwarkesh Patel:

但从中得出的含义是什么?当Dario上播客时,我问他的事情是,如果你真的期望模型在在职学习能力上像人类一样,你为什么要试图烘焙所有这些与PowerPoint等工作的技能?你不就期望模型在部署时能够学会这些吗?

有几种不同的解释。一种是我们期望模型很快达到那里,但它们还没有,所以为什么不把这些技能摊销到模型训练中?另一种是我们不专注于让它非常擅长广泛部署的工作。我们只是让它非常擅长RSI。这只是我们获得收入的一种方式,以便我们可以把它倒回一个真正擅长做RSI开发的模型中。然后一旦奇点发生,另一端出来的东西将非常擅长所有对当前一代模型来说似乎是瓶颈的事情。

John,我不知道你是否对如何理解为什么这些模型中有这么多任务特定知识有看法,如果路径是这种泛化的话。

John Schulman:

如果模型在上下文中学习足够好,那么理论上,你不需要在金融上训练它们。它们可以即时阅读所有书籍并弄清楚如何在适当的司法管辖区做一切。你可以争辩说,你需要做很多领域特定的训练只是为了让它们更高效。即使它们足够聪明可以在飞行中弄清楚,你仍然可能想要做一堆RL并把所有这些直觉烘焙到权重中,这样模型在运行时会更高效。

在实践中,模型提供商似乎确实在逐个领域地尝试加强模型在最高价值领域的能力。我会说这是模型为什么变得好得多的答案之一。只是因为模型提供商已经覆盖了很多高价值领域和最常见的技能类型。

Beren Millidge:

另一件事是,同时做两件事并不那么昂贵。模型是巨大的。就参数而言,它们可以轻松负担学习一切。可能会有一些迁移。即使金融不特定,信息对RSI也很重要。只是关于如何弄清楚什么重要、如何有品味、如何做长视界工作的一般元学习可能具有泛化性。

世界上也没有那么多RSI数据。它很难生成,需要很多努力。所以如果你能在这个其他数据中摊销,你就能从中得到一些迁移。你已经有大量的计算和大量的参数空间,所以为什么不同时做那个,以及显然的销售模型的直接商业意图?

John Schulman:

我要补充的是,有一个问题是这种当前的仿真到现实范式是否会永远占主导地位。你看看现实世界的任务是什么样的。然后你尝试创建一堆可以在数据中心模拟的环境,你可以对它们做RL。显然,这非常成功。但它有很多弱点,因为很多事情就是很难模拟,特别是如果它们涉及与一堆人类实时互动。所以有一个问题是仿真到现实是否会永远占主导框架。

Beren Millidge:

我认为只要样本效率低,仿真到现实就必须是主导框架,因为现在你需要成千上万次与人类的互动。没有人会坐在那里成为RL训练的循环中。所以我们现在必须模拟那个来获得你需要的样本。但显然,如果样本效率大幅提高,你会期望从部署中学习成为更大的部分。

John Schulman:

不过你也可以做其他事情。你可以离策略学习,所以你可以取所有轨迹,即使不重新模拟一切,你也可以潜在地从中学到东西。

Dwarkesh Patel:

我想多问一下这个,因为很奇怪,你有50%的计算花在推理上,而这并没有直接帮助模型变得更好。你期望数字心智最终拥有的一个关键优势是,不像人类有50年的现实世界经验,模型将通过其所有实例,在经济中所有经济相关工作中获得数百万年的部署经验。现在,那个数据在有意义的意义上并没有帮助模型变得更好。

看起来如此明显,最终模型应该能够从这个数据中学习。一旦它们这样做了,你就会有某种感觉像是广泛部署的智能爆炸的东西,因为模型正在所有这些部署实例中吸收如此多的信息。你期望这种蜂群思维、疯狂的东西什么时候开始发生?

Beren Millidge:

我认为从非常基本的层面来说,这已经在发生了……只是在下一代模型中。现在,你显然可以取你的部署数据,把它放入未来模型的预训练或中期训练中,特别是如果你做一些过滤或某种判断或注释或合成的话。

Dwarkesh Patel:

你认为这在多大程度上解释了代际改进?

Beren Millidge:

我认为它解释了相当多。我不知道实验室是否这样做,因为理论上他们声称不在人们的数据上训练。但其他国家100%这样做。他们肯定得到这个优势。这基本上就是蒸馏。他们取模型,通过ping模型获得一部分部署数据,然后他们在此基础上训练下一代模型。他们当然也可以在自己的模型上这样做。完全没有理由不这样做。

Charlie O'Neill:

我完全同意。如果你退得足够远,这肯定在发生。我们都在想象的,持续学习的圣杯,是这个非常有机的、实时的循环,一个单独的模型获得经验并即时实时更新并从中学习。当你放大到那个粒度时,很多事情会崩溃。但大实验室正在这样做。闭源模型正在这样做。

也有早期迹象表明人们使用开源模型以更快的节奏这样做。一个很好的例子可能是Composer。Harvey在法律智能体上也在做同样的事情。你有某种模型,你从你拥有的特定任务数据中获得非常具体的环境,以及用户抱怨的事情,以及你以某种方式从你的特定部署中提取的所有反馈。很多这些公司比大实验室有优势,因为他们可以真的非常好地使用这个数据。

然后他们会创建环境。他们会对Kimi K3进行大的后训练。他们会部署它。他们也可能做一些在线学习,就像Composer做在线……基本上是REINFORCE很长时间。

仍然有人在循环中。仍然有人说,“好吧,这些是我们关心的信号。这是我们将如何从我们拥有的数据中创建环境。”它仍然比你想象的那个节奏要长,但它确实在发生。最终那个循环会越来越快。

Dwarkesh Patel:

Composer的事情很有趣,因为在Cursor中,人们按Tab或不按Tab在模型建议的下一个补全上。基于此,每一天,Composer在预测下一个方面变得更好——

Charlie O'Neill:

那是旧的Tab模型。他们实际上对实际的生成模型也做了同样的事情,不仅仅是Tab模型。

Dwarkesh Patel:

哦,我明白了。有趣。

Charlie O'Neill:

这很难,因为当你做在线强化学习时,你没有组。你只有一个用户说一件事,然后你得到一个rollout。所以你有一个很大的方差减少问题。

Cursor对此的模糊答案是,“我们有非常好的启发式方法,能够估计这个响应比平均好多少,或者比平均差多少。”然后他们会做这个大的REINFORCE更新。他们对它是否变差的解决方案是,如果它在CursorBench上改进了,他们每五小时部署新模型。如果没有,他们就扔掉那个版本。

John Schulman:

我认为你最大的问题实际上只是不知道自然数据的奖励函数应该是什么。如果你使用某种肤浅的信号,比如他们是否接受了编辑,那可能会以某种方式被奖励黑客。

00:45:24 – 仿真到现实的鸿沟

Dwarkesh Patel:

但这不是仿真到现实事情的更大问题吗?任务视界越长,就越难在数据中心内模拟。在我看来,即使在编程中,我们已经到了没有一个为期一年的编程任务最终不需要你与客户交谈或与公司互动或与用户互动的点。

如果你想想我们想要AI能够做的所有事情,最终超级智能应该能够经营企业,或创办新企业并使其盈利,或在市场上进行有利可图的日内交易,或赢得官司。这些都是很难在数据中心模拟的事情。其中固有的学习部分是与现实世界互动。

也许它们从仿真到现实的迁移中学习如何在这些事情上变得更好。但或者,也许你确实需要从这些类型的互动中进行权重更新才能变得更好。如果是这样的话——如果迁移不够强,你确实需要权重更新——那么模型样本效率相当低可能是一个更深层的问题。

我对此好奇的原因是,默认情况下,我看不出你怎么会在未来10年内不得到某种疯狂的递归自我改进。但这可能不发生的唯一原因是,在权重更新的样本效率方面,模型似乎远远落后于人类。它们可能比人类在从出生到成年看到的数据量 versus 模型从冷启动到完成训练看到的数据量方面落后百万倍。

这一切是说,首先,从模拟到我们想要AI在现实世界中做的极其长视界、非常复杂的真实事情之间会有良好的迁移吗?如果没有,那是否真的意味着这些模型缺乏样本效率会反咬我们一口?

Charlie O'Neill:

也许我分解两种类型任务的方式——模型变得擅长的任务和模型将继续挣扎的任务——是看任务是累积的,还是你有这个非平稳分布,你必须不断学习和重新争论一堆东西。

一个累积任务的例子可能是RSI。理论上可能有一个不到一百万token的Python文件,从头开始训练一个能够递归自我改进的模型。你做的每一个发现都是你守住的一条线。如果RSI不需要我们发现新的注意力变体之类的,那么一旦你发现了注意力,一旦你发现了混合专家,一旦你发现了GRPO,你就把它添加到训练堆栈中,它就在那里了。

一个很好的例子是5.6 Sol训练,5.6 Terra,或者OpenAI告诉我们的任何一个。它不需要回头发现注意力。它基本上会调用一堆脚本,像pre-training.sh和post-training.sh,然后就这样做。那是累积任务的一个例子。

我认为现实世界——以及人们如此思考持续学习的原因——并不是一个累积任务。想象在一家律师事务所,你有一个智能体作为法律助理。那是一个非常非平稳的分布。你必须能够在你的上下文中容纳公司里所有重要人物之间的所有关系,这些关系也一直在变化。你有所有这些关于事情如何做的隐含方式,在哪里找信息,等等。那不是像RSI那样干净的累积任务例子。

我认为任务之间会有这种分解。但如果实验室意识到这一点——他们确实相信RSI是累积的,即我们不需要回头发现某种全新的架构之类的——那么也许越来越多的努力和计算会集中在那个上面, versus 其他任务。

Dwarkesh Patel:

RSI恰好比当律师助理更容易,这真是太不幸了。

John Schulman:

我想说今天的模型在很多不同方面都比人类弱。其中一些可能与某些 regime 中的样本效率有关。在某些 regime 中,模型非常样本高效,比如在上下文中学习。但可能有一些中等长度的 regime,它们样本效率较低,因为人类可以比模型更高效地做某种权重更新。我认为在某些 regime 中样本效率较低可能是弱点的来源之一。

但我认为还有其他完全不同的弱点来源。例如,思维的多样性低于人类,或者在某些长视界判断上表现不佳。我认为很多人们称之为品味的东西是关于长期有效的行为,是人们已经意识到长期有效的行为。不是全部,但品味的某些方面。特别是对于软件工程,我认为很多品味是“什么系统在项目的长期运行中可维护且运行良好?”

模型有各种各样的弱点限制RSI以及其他事情。有些与样本效率有关,有些无关。

Charlie O'Neill:

也许一个有趣的思想实验是:假设你能够给一个模型一个一万亿token的上下文窗口,或者你需要容纳你在RLHF之前的经验所需的任何东西。它在上下文窗口中有所有这些经验,并且它具有与一百万token时相同的样本效率和上下文学习能力。你认为品味就解决了吗?它能够做出与你相同的判断吗?还是除了更长的上下文窗口和相同的样本效率之外,还有什么根本性的缺失?

版权声明:
作者:主机优惠
链接:https://www.techfm.club/p/238319.html
来源:TechFM
文章版权归作者所有,未经允许请勿转载。

THE END
分享
二维码
< <上一篇
下一篇>>