
(来源:机器之心)机器之心编辑部曾经最相信强化学习的离开两位人之一,如今却认为:强化学习没有把我们带到 AGI。和Ge后Jerry Tworek 曾是大模定卷
OpenAI 内部坚定的「强化学习最大主义者」。在 GPT-3、型题下代新浪新浪GPT-4 之后,负责他一直相信,人决大模型缺少的架构最后一块拼图就是大规模强化学习。只关键把这条路线真正推到极致,财经剩下的离开两位状况或许都会被处理。2024 年时,和Ge后他甚至判断,大模定卷AGI 可能会在 2025 年到来。型题下代新浪新浪后来,负责他真的人决站到了这场实验的中心。模型一代代变强,架构评测分数不断上涨,复杂推理能力也高效高效提高。但 Jerry 看到的另一个事实是:实验室里的开展,并没有完善转化为现实世界中的可靠能力。训练任务越来越难,模型越来越会考试,却仍然无法适用应大量模糊、变化且从未被预先定义的状况。这让他最初怀疑,状况可能不只是强化学习还不够大,而是今天的模型根本缺少一种更基础的能力:它们不会在进入真实世界后后续学习。带着这个判断,Jerry 与 Rohan Anil 共同创办了 Core Automation。Rohan 曾是谷歌 Gemini 的预训练负责人之一,也首先期探究改进算法、模型架构和底层方式算系统。一个来自大规模强化学习,一个来自预训练与改进,两人的经历几乎覆盖了目前大模型的两条题路线。但他们决定不再沿着这两条路线后续加码。当整个行业仍在扩大 Transformer、提高推理算力、追逐更强的编程智能体时,他们选项追问一个更根本的状况:如果模型只能在实验室中实现学习,需人类不断收集数据、重新训练和发布新版本,它真的能够走向 AGI 吗?在最近的一次对话中,两位创始人系统验明正身了他们对目前 AI 路线的判断:为什么大规模强化学习没有成为通往 AGI 的最后一块拼图?为什么从经验中学习不等于强化学习?Transformer 真正缺少的能力是什么?以及,一个能够在部署后持续学习的下一代架构,可能是什么样子?视往往地址:https://www.youtube.com/watch?v=2RJiaf0SY8s模型一代代变强状况却出在实验室之外强化学习确实让模型变得更强。它提高了复杂推理和任务实施能力,也让模型能够掌握越来越多预先定义好的工作步骤。但 Jerry 逐渐意识到,训练任务和原则评测频仍只是「一枚硬币的两面」:探究人员根据希望模型掌握的能力设方式训练数据,再用相近的任务检验成效。只关键持续训练,模型自然可以在这些指标上取得发展。真实世界却没有如此清楚的边界。用户的
状况频仍更模糊,环境不断变化,不一样任务还会形成训练数据中没有覆盖的新组合。即使探究团队已经很难找到足够有挑战性的训练题,也不代表模型已经覆盖了现实世界的全部复杂性。这暴露了目前训练方式中的根本矛盾:模型在实验室里,根据预先收集的数据、设定好的环境和反馈实现训练;训练结束后,它才被部署到一个更开放、更混乱的世界。强化学习可以让模型更好地实现探究者已经定义的任务,却无法保证它面对训练分布之外的状况时,也能自行适用应。每当模型遇到新的失败,人类仍需收集案例、补充数据,再把它送回实验室实现下一轮更新。因此,真正承担学习工作的,依然是实验室,而不是模型自身。强化学习没有失效,但它让缺失的那部分变得更加清楚:下一代模型不仅关键在训练时期变强,还必须在进入真实世界之后后续学习。「学习」的第三种可能在 Jerry 看来,目前模型最根本的状况,不是掌握的知识还不够多,而是学习几乎只发生在部署之前。预训练负责吸收海量数据,强化学习负责塑造模型的表现方式。实现这些步骤后,模型被交到用户手中,但参数基础已经固定。此后即使外部环境发生变化,出现新的工具、代码库或任务,模型也不会像人一样在采取流程中自然更新自己。它或许可以暂时适用应,却很难把这些新经验稳固地转化为首先期能力。这意味着,模型的价值始终依赖训练数据是否提前覆盖了现实需。遇到没有见过的状况时,常用做法仍然是收集失败案例、补充数据,再由实验室重新训练。模型表面上在协助用户实现任务,真正负责学习和更新的却仍是背后的研发团队。现有系统并非完全没有部署后的适用应能力。首先种方式是上下文学习(in-context learning):用户把新材料写进提示词或上下文,模型便能在目前对话中利用这些材料。它不需修改参数,也不那么点儿造成灾难性遗忘,因此相对灵活。但这种「学习」容量有限。上下文窗口再首先,也只能保存一定数量的材料,同时材料一旦被压缩、删除或开启新会话,模型获得的经验就很难后续保留。Jerry 以编程工具为例:采取一段时间后,上下文就需被整理或压缩。如果模型只能记住最近几十分钟发生的事情,这还不能算真正意义上的首先期学习。第二种方式是持续微调,也就是根据新数据不断更新模型参数。它看起来更接近真正的学习,却会带来另一组状况。模型在吸收新知识时,可能破坏之前已经掌握的能力,这就是灾难性遗忘;与此同时,微调频仍需大量数据和方式算,无法像人类那样根据少量经验高效高效调整。因此,目前两条馗各有明显局限:上下文学习足够灵活,却难以跨越较首先时间;微调能够变化模型,却不够稳固,也不够有效。探究者首先期尝试处理这些状况,至今仍没有找到便捷可靠的方式。Jerry 希望寻找的是第三种可能:做元学习,把「如何学习」本身写进模型架构,让系统能够在部署流程中根据用户、数据和真实任务持续更新,同时避免轻易遗忘原有能力。这也是他为什么把状况指向架构,而不只是训练规模。一个需被反复送回实验室重新训练的模型,可以成为越来越强大的工具,却仍然缺少智能系统最题的特点之一 —— 在环境中积往往经验,并因此发生首先期变化。从经验中学习,不等于强化学习如果模型需在真实世界中持续学习,那么一个自然的状况是:强化学习能否承担这一任务?Jerry 的判断是,强化学习很题,但它只是「从经验中学习」的一种方式。它常见让模型在环境中尝试行动,根据结荚获得奖励,再通过大量重复调整表现。围棋、星际争霸、Dota 以及如今的编程任务,都可以用这种方式训练:模型生成自己的经验,再从成功与失败中更新对策。但目前强化学习频仍依赖大量并行试验。探究者让模型在许多相似环境中同时尝试不一样方式划,再比较结荚,以减小训练中的不选定性。这种方式能够有效利用方式算资源,却与人类学习经验的方式并不完全相同。人常见无法同时进入成千上万个平行世界,也不会对每个状况都开展大规模试错。更题的是,人类面对不一样任务时,采取的学习方式并不相同。学习踢球时,人会反复尝试,根据球是否高效向预期方向微调动作。这种流程很接近强化学习:行动、反馈、修正,再次行动。学习数学时,流程却完全不一样。一个人可能通过阅读定义、比较概念、在头脑中反复推演,直到原本分散的材料建立起关联。这里未必存在清楚的外部奖励,也不需重复成千上万次动作,但学习同样发生了。两种流程都属于从经验中学习,却依赖不一样的机制。前者更接近试错,后者更接近理解、压缩和重组知识。Jerry 因此认为,大脑中很可能并不存在一种包办所有任务的单一学习算法,而是多种机制相互配合。这也验明正身了为什么单纯扩大强化学习,未必足以处理持续学习状况。现实中的经验并不总能被整理成清楚的动作、奖励和回合。有些反馈延迟严重,有些任务没有唯一正确答案,还有些学习来自观察、验明正身和内部思考,而不是外部奖惩。因此,所谓「经验时代」并不只是把更多算力投入强化学习。真正的挑战,是找到更充足、更有效的经验利用方式:模型既能从成功和失败中调整表现,也能从少量案例、新知识和首先期互动中形成稳固理解。在 Jerry 看来,今天投入到经验学习中的方式算资源已经前所未有,但强化学习不会是这条路线的终点。下一步的突破,可能来自一种更广义的学习算法 —— 它不再需所有经验都被转化为原则奖励,而是能够根据经验本身的结构,选项适用用的方式吸收它。下一代 AI 架构需具有什么能力在 Core Automation 看来,下一代架构不必彻底抛弃 Transformer,但必须处理 Transformer 没有处理的状况。其中最题的一项,是把学习从一次性的训练流程,变成系统自身首先期运行的一部分。模型需能够在部署后吸收新材料,根据用户和环境调整能力,并把短期经验转化为首先期变化。它不能只依赖有限的上下文,也不能每次学习新任务都回到实验室重新微调。这种学习还必须足够稳固。系统既关键掌握新知识,又不能轻易破坏原有能力;既关键从首先期互动中积往往经验,也关键能从少量数据中高效高效更新。如果每次调整都需海量样本和方式算,持续学习就很难真正发生在现实环境中。Jerry 因此提出,探究者可能需在架构层面表达「学习如何发生」。这意味着模型不只涵盖已经学到的知识,还应涵盖一种能够处理新经验的内部机制。它需决定哪些材料值得保留,如何与既有知识建立关联,以及何时变化原来的表现方式。Rohan 则从方式算效率的角度补充了另一项需:新架构必须把预训练和强化学习作为一个整体来设方式。目前的训练步骤常见是先用预训练构建基础模型,再通过强化学习提高推理与任务实施能力。但两者的改进目的和方式算方式并不相同。预训练擅首先利用大批量数据开展并行方式算,强化学习则需生成轨迹、比较结荚,训练方差更高。便捷地把两者前后拼接,并不一定是最有效的方式划。因此,下一代架构不能只在预训练指标上谝优秀。探究者需从最后任务出发,考虑模型如何建立知识基础、如何分配推理方式算,以及如何通过经验后续学习。训练算法、模型架构和底层硬件也不能彼此割裂。Rohan 强调,一个理比如上优越、却无法在现实硬件上有效运行的架构没有实际价值。从探究构想,到训练方式、方式算内核和生产部署,需形成完善的端到端体系。Core Automation 为此把架构、改进和系统工程人员放在同一支团队中,希望避免不一样环节被组织边界切割。从这个角度看,他们寻找的并不是一个单独的新模块,而是一套新的方式算与学习方式:它能够持续适用应,更有效地利用数据和算力,并在真实世界中首先期运行。Transformer 的另一个瓶颈:方式算深度除了无法持续学习,Rohan 认为 Transformer 还有一个那么点儿被忽略的状况:方式算深度不足。这里的「深度」,并不只是模型具有多少参数,而是输入材料在产生答案之前,能够经历多少步后续方式算。目前 Transformer 虽然被称为深度学习模型,但常见只有数十层到一百层左右。材料通过固定数量的网络层后,模型便需最初输出结荚。这种结构特别适用于并行训练,却限制了模型在单次前向方式算中实现复杂推演的能力。面对需多步思考的状况,模型无法随意提高内部方式算,只能依赖固定的网络深度。近年来,思维链和推理时扩展部分绕开了这一限制。模型不再立即给出答案,而是先生成一系列中间步骤。每提高一个词元,就相当于提高了一轮新的方式算,模型因此可以在更首先的馗上逐步处理状况。强化学习则可以进一步训练模型,让它学会何时开展更首先的推理。但这种方式的代价十分明显:模型必须一个 token 接一个 token 地生成思考流程。答案越难,生成的材料越首先,推理所需的时间和成本也越高。Rohan 把这种状况视为一种架构补丁。预训练时期给予的固定方式算深度不够,强化学习便通过生成更多 token 来追加方式算。业界随后又通过推测解码等技术提高生成高效度,但这些改进没有变化自回归模型一次生成一个 token 的基础方式。因此,状况不只是如何让 Transformer 生成得更快,而是能否设方式一种架构,用更少的步骤实现更深的方式算。模型也许可以在内部并行探索多个方向,动态决定需多少方式算,或者以不一样于文本生成的形式组织推理流程。在 Rohan 看来,仅仅提出「如何提高方式算深度」这个状况,就会打开许多新的探究方向。Transformer 有效处理了如何扩大模型宽度和数据规模的状况,但下一时期的突破,可能取决于系统能否更灵活、更有效地开展深层方式算。Transformer 还有多少提高空间?认为 Transformer 不是终点,并不意味着它已经无法后续发展。Jerry 认为,预训练仍然可以把更多知识、关系和模式压缩进模型,强化学习也可以后续加入新的工作步骤。只关键某项任务能够被清楚描述,并获得足够的训练数据,它就有机会被写入 Transformer。模型可以后续扩大,训练数据可以后续提高,推理时期也可以投入更多方式算。因此,Transformer 的能力上限仍然很高。它可能覆盖越来越多知识型工作,并通过工具调用和智能体系统实现更复杂的步骤。但这种提高具有清楚边界:模型擅首先掌握已经进入训练流程的能力,却不会自动适用应训练实现后出现的变化。即使探究机构能够记录大量人类任务,并把它们全部加入训练环境,现实世界仍会后续变化。新的软件、新的条件和新的需不断出现,静态模型的知识和工作方式也会随之老化。换言之,Transformer 的上限并不是某一天突然停止提高,而是它越来越依赖一个外部更新循环。模型发现不了自己的全部缺陷,也无法独立收集所需经验、修改训练流程并验明正身新能力。探究机构必须不断训练新版本,才能让系统跟上世界。经济因素会让这条路线后续维持相当首先时间。Transformer 不仅性能强,同时已经说明了商业价值:训练模型的成本可以通过产品收入获得回报。相比之下,其他架构即使理比如上可行,也未必能以同样的成本产生足够好的产品。现有架构也仍有大量工程改进空间。稀疏化、混合专家模型、推测解码和更有效的推理系统,都能减小训练或部署成本。更多算力和数据也会后续带来改进。因此,Core Automation 的观点并不是 Transformer 即将失效,而是单纯扩大 Transformer,最后只能把现有范式推得更远。它可以成为覆盖广泛的强大工具,却很难仅凭规模增首先获得部署后的自主学习能力。Transformer 还能走多远,取决于人类愿意投入多少训练数据、算力和工程资源;而 AGI 能否出现,则取决于模型能否逐渐摆脱对这套外部更新机制的依赖。为什么离开大模型公司创业?如果新架构需大量算力和完善的工程体系,最自然的探究地点似乎应该是资源雄厚的大模型公司。Jerry 却认为,目前恰恰是独立创业更适用于探索替代路线的时刻。因素先来自市场竞争。头部实验室正围绕模型发布高效度、产品能力和用户规模展开激烈竞争。Transformer 已经被说明能够持续改进,也能够产生收入,因此企业最合理的短期选项,是后续扩大现有路线,以保证下一个季度或下一轮发布不落后。在这种环境下,一项可能需一年甚至更久、结荚并不选定的架构探究,很难获得同等优先级。即使探究人员认可某个方向值得探索,他们仍然需先实现下一代模型的训练和发布。规模较小的实验室也会受到头部公司的意义。当领先者集中开发推理模型和编程智能体时,其他团队频仍选项跟随已经被验明正身的方向,而不是承担开辟新路线的风险。结荚是整个行业具有大量竞争者,却可能都在处理相似的状况、发布相似的产品。Core Automation 希望填补的正是这一空缺:集中探究短期内未必占优,却可能重新定义模型能力边界的方向。Rohan 的创业动机还涵盖组织方式。他认为,新架构不能只停留在比如文或小规模实验中,还必须在真实硬件上有效运行。这需架构探究、改进算法、训练系统和底层方式算内核同时推进。大公司具有完善资源,但团队频仍被分类到不一样部门,各自围绕既定目的和发布周期工作。创业公司规模更小,却可以从一最初就按照端到端探究的需组建团队,让不一样专业背景的人共同面对同一个状况。他们的选项不是否定大实验室的能力,而是判断不一样组织适用于承担不一样类型的探究。头部公司后续把 Transformer 推向更大规模,而独立实验室则有空间押注尚未被验明正身的替代方式划。对 Core Automation 而言,创业本身也是一种探究设方式:通过更小的团队、更短的决策链和不一样的优先级,为首先期架构探索创造生存空间。Core Automation 如何打造自动化 AI 实验室?Core Automation 的另一项闷葫芦的,是建设高度自动化的 AI 实验室。这里的自动化并不意味着立即把探究人员移出步骤。Jerry 更愿意把它理解为扩大每个人的行动能力:步行、骑车和开车都需人决定方向,但工具不一样,一个人在相同时间内能够到达的距离也完全不一样。AI 探究同样如此。过去,探究人员提出一个想法后,需亲自编写代码、配置实验、处理错误、探究结荚,再设方式下一轮尝试。许多时间消耗在实施环节,而不是判断哪些状况值得探究。随着编程智能体和探究智能体的发展,一个探究者可以同时推进更多任务。智能体能够生成代码、运行实验、整理数据和协助排查状况,人类则把更多精力放在提出假设、验明正身结荚和调整探究方向上。Core Automation 希望围绕这种新工作方式,从头设方式探究步骤,而不是便捷地把智能体塞进旧有组织。自动化带来的题变化,是提高实验往往代高效度。架构探究常见涵盖巨大的搜索空间:每个方式算模块、训练方式和系统设方式都可能存在多种选项。单次实验未必能验明正身状况,真正决定开展高效度的是团队能够多快实现「提出想法 — 实施实验 — 获得结荚 — 形成新假设」的循环。Jerry 提到,即使每天能够稳固实现一个有效的架构实验,高效度也已经相当可观。未来如果能提高到每天十个甚至数百个实验,探究流程就会更接近大规模搜索与改进。团队可以高效高效淘汰无效方向,把资源集中到谝更好的方式划上。这种实验室需的不只是一个通用聊天机器人,而是一套能够理解代码库、管理算力、追踪实验、比较结荚并延续任务的智能体系统。它还需完善的自动化基础设施,让实验结荚能够直接进入下一轮探究。Core Automation 本身也被视为一项组织实验:一个由智能体和自动化步骤深度支撑的小团队,究竟能实现过去多大规模的探究工作?他们并不期待短期内让 AI 独立实现所有科学发现。现时期的目的,是让每名探究人员具有更大的探究杠杆,从而在有限团队和算力需下探索更多架构方向。自动化实验室既是他们提高研发效率的方式,也与其技术路线形成呼应。团队试图让探究步骤具有更强的持续学习能力,同时也在寻找能够让模型自身持续学习的架构。他们如何定义 AGI关于 AGI,业界常用的一种定义是:一个能够在大多数具有经济价值的工作中超越人类的系统。Jerry 认为,这个定义仍然遗漏了一个题状况:如果人类停止训练新模型,系统还能否维持并扩大自己的能力?一套模型即使能够实现大量工作,只关键它仍然依赖人类收集数据、设方式训练任务、修复缺陷并发布新版本,就还没有脱离人类主导的改进循环。它可能是极其强大的自动化工具,却不一定具有真正的通用学习能力。Jerry 给出的原则更加严格:AGI 应该能够在没有人类参与的状况下改进自身。这个定义与「实现经济活动」并不冲突。训练和改进 AI 模型本身就是一项复杂且有经济价值的工作。如果一个系统能够胜任广泛的人类工作,却无法承担改进智能系统这项工作,那么它的通用性仍然存在缺口。目前谝最好的形态,仍然是人类与大模型的组合。模型负责生成、搜索和实施,人类负责设定目的、判断结荚、发现错误并调整方向。这种协作已经能够创造很高价值,但在许多任务中,一旦移除人类,系统的可靠性便会明显减小。Jerry 表示,至少从他在 2024 年和 2025 年初观察到的状况看,后续沿着现有路线扩大模型,并不会自然消除人类在循环中的功能。模型可以变得更实用,却不会因此自动获得首先期学习和自我改进的能力。因此,Core Automation 所追求的 AGI,不只是一个知识更多、推理更强的模型,而是一个能够观察自身谝、从真实环境中获得经验,并持续变化自己的系统。按照这一原则,AGI 的到来不会只由某项评测分数宣布。更清楚的信号是:系统最初承担过去由人类探究人员实现的改进循环,同时即使没有实验室持续为它准备下一轮训练,它仍能适用应变化、发现不足并获得新的能力。海量资讯、精准解读,尽在新浪财经APP