引言:AGI范式拐点,规模虽未到头,却需新建机制

过去数年,全球AGI研发长期被规模涌现理论主导。行业普遍信奉:持续扩大预训练数据、算力、模型参数,叠加更大规模的离线强化学习(RL),就能不断解锁新能力,最终自然涌现通用人工智能。这一范式支撑了GPT系列、主流大模型的快速迭代,催生了CoT思维链、智能Agent等里程碑技术,让AI的推理、规划、工具使用能力实现跨越式提升。

但随着技术落地深入,行业核心研究者的认知正在发生根本性反转。虽然LLM的规模定律上限依旧很高,但前OpenAI核心研究员Jerry Tworek已经从坚定的RL最大主义者转向反思,否定了单纯放大RL规模通往AGI的可能性;DeepSeek的梁文锋则提出一套不可跳步的渐进式AGI技术阶梯,明确阐述了一条从传统大模型到终极AGI的完整演进路径,并直指持续学习是当前AGI研发的核心瓶颈

当下AGI的真正竞赛,早已不是算力与数据的军备竞赛,而是底层智能机制的重构竞赛。本文将结合两位一线研究者和行业执牛耳者的核心观点,从底层技术原理出发,系统拆解大语言模型、强化学习、CoT、Agent、持续学习、元学习、自我迭代、具身智能的递进逻辑,厘清各技术的边界、价值与核心困境,完整还原通往AGI的真实技术路线。


AGI范式的RL放大派渐遇质疑

在新的技术认知体系中,首先需要破除的核心误区,就是无限放大离线强化学习即可抵达AGI。所谓RL放大派,核心主张是:依托现有“离线预训练+离线RL调优”范式,持续增加RL训练样本、算力、奖励信号规模,依靠规模涌现效应,就能突破所有能力瓶颈,实现通用人工智能。

Jerry Tworek通过大规模工程实验验证了该范式的终极局限,其核心否定逻辑并非否定RL的价值,而是证明RL是AGI的必要条件,但绝非充分条件,单纯堆规模无法跨越通用智能的鸿沟,底层原理包含如下七个基础逻辑:


优化目标局限:仅拟合训练分布,不生成通用认知

传统深度RL的核心优化目标是最大化固定训练数据集内的奖励期望,所有迭代仅服务于适配人工设计、筛选的训练任务分布。它只能让模型在“见过的考题”上持续精进,无法习得一套适配未知场景的通用认知机制。无论如何放大规模,模型都只能优化已知任务的表现,无法自主推导全新场景的运行逻辑,这也是“实验室评测满分,真实场景翻车”的核心根源。


分布偏移无解:离线训练无法闭合开放世界的认知鸿沟

真实世界是典型的开放世界,持续诞生新概念、新规则、新场景,存在无穷无尽的分布外(Out‑of‑Distribution)样本。而传统RL是完全离线范式,训练集是固定、有限的静态集合。规模放大只能轻微缓解分布偏移,无法从根本上覆盖无穷的真实场景,模型一旦脱离训练分布,鲁棒性会急剧崩塌。


搜索空间爆炸:维度诅咒锁死离线探索的上限

开放世界的状态、动作空间呈组合爆炸式增长,属于高维连续无穷空间。根据维度诅咒原理,RL所需的交互样本量会随空间维度指数上升,无论算力与数据规模提升多少数量级,离线训练只能覆盖状态空间的极小一部分。高维空间下样本极度稀疏,模型的插值泛化毫无理论保障,无法依靠离线穷尽探索实现全域可靠。


训练与部署的时空割裂:学习回路被永久冻结

这是最核心的架构级缺陷。传统RL的所有试错、梯度更新、能力迭代,全部发生在离线训练阶段。模型部署上线后,权重完全冻结,推理阶段无任何学习回路。人类智能的核心是“在实践中持续成长”,而静态RL模型是“实验室训练完成后永久固化”,算力规模无法弥补这一架构性缺失。


无原生元学习能力:只会解题,不会“学会学习”

大规模离线RL仅能实现上下文内的临时少样本适配,这种伪元学习依赖会话上下文,会话结束后所有经验全部丢失,无法沉淀为模型固有能力。同时,离线RL容易引发元过拟合,模型仅能适配训练任务的学习套路,面对全新异类场景完全失效,无法自动涌现出运行时可用的通用元学习机制。


奖励信号的外部依赖:无法自主生成学习目标

传统RL高度依赖人工标注、模型打分等外部奖励信号,而开放世界中绝大多数场景没有预设的对错标准、现成奖励。人类的核心学习能力来源于自我预测误差、环境交互反馈的内生学习信号,而非外部打分,这是RL范式永远无法通过规模弥补的先天短板。


涌现的边界:规模只能放大能力,不能创造新机制

AI的涌现能力,必须建立在架构具备对应能力的潜在表达空间之上。现有Transformer+离线RL架构,原生缺失运行时学习、分层记忆更新、元优化回路等核心机制。规模放大可以强化推理、对齐、规划等已有能力,但无法凭空创造架构本身不存在的通用生长机制。


RL放大派的终极悖论清晰显现:规模可以让模型更会做已知的事,但永远无法让模型学会做未知的事。这大概也是梁文锋提出渐进式AGI路线基于的底层逻辑。

AGI渐进式完整路线:不可跳步的六级技术阶梯

针对传统范式的困境,梁文锋提出了一套高度贴合底层原理、严格递进的AGI演进路线:语言大模型 $\to$ CoT思维链 $\to$ Agent智能体 $\to$ 持续学习(核心瓶颈)$\to$ 模型自我迭代(渐进奇点)$\to$ 具身智能

这个路线的核心逻辑是:

  • 每一级能力都是后一级的必要前提,无任何跳步可能;
  • 持续学习是区分“工具型AI”与“通用智能AGI”的分水岭。

整条路线层层递进,从静态认知到动态思考,从被动输出到主动成长,从软件智能到物理智能。


语言大模型:静态通用知识库基座

大模型预训练是所有AGI能力的底层基础,通过海量文本数据训练,习得人类语言体系、通用知识、基础逻辑模式,具备问答、生成、基础理解能力。但其本质是静态冻结系统:所有知识、能力均来自离线训练,模型上线后无法自主新增认知、沉淀经验,仅能调用已有知识库,不具备思考、执行、成长能力,是纯粹的“知识存储工具”。


CoT思维链:解锁静态模型的多步推理能力

CoT的核心价值是打破大模型“直接输出答案”的局限,通过分步拆解、渐进推演,让模型实现复杂逻辑、数学、代码类任务的多步推理,大幅提升模型的逻辑能力。

但CoT从未改变模型的静态本质:所有思考过程仅存在于会话上下文Token中,属于推理时的算法技巧,不更新模型权重、不固化认知。模型可以“临时思考”,但无法“留存思考经验”,解决了推理效率问题,但未解决能力成长问题


Agent智能体:实现环境行动闭环,但无学习闭环

当前行业火热的Agent,是在LLM+CoT基础上,增加了规划、工具调用、记忆检索、多轮执行能力,让AI从“被动问答”升级为“主动做事”,可以自主完成复杂的跨工具、长时序任务,打通了AI与外部世界的交互通道。

梁文锋明确指出Agent的本质局限:现代Agent只是静态大模型的调度外壳,绝非真正的通用智能

  • 其一,Agent的所有经验仅存储在外部数据库,依靠Prompt检索复用,无法内化到模型权重;
  • 其二,任务执行的失败、成功反馈仅生成日志,不会驱动模型自我优化;
  • 其三,每次全新任务,模型本体依旧是初始静态状态,过往的经验无法沉淀为固有能力。

简言之,Agent实现了行动闭环,但始终缺失学习闭环,能做事、但不会越做越聪明,是通往AGI的关键过渡形态,而非终极形态。


持续学习:AGI的核心瓶颈,从静态工具到生长型智能的质变

持续学习是整条AGI路线的核心枢轴与最大瓶颈,也是区别传统AI与AGI的核心标志。如果说RL、CoT、Agent都是能力增强技术,持续学习就是智能机制重构技术

其核心定义是:模型在部署运行阶段,通过真实环境的交互反馈,自主、增量式地吸收新知识、修正错误、迭代策略,同时抑制灾难性遗忘,保留历史能力,实现终身、在线、无人工干预的进化。

持续学习从根本上解决了传统范式的所有致命缺陷:

  • 通过运行时在线学习,绕开离线搜索空间爆炸的难题;
  • 通过实时适配分布外场景,解决真实世界泛化问题;
  • 通过经验内化,打通训练与部署的时空壁垒。

同时,持续学习天然耦合元学习能力:不止是持续学新知识,更是学会如何学习。通过内置元优化回路,模型习得通用学习策略,能够以小样本、低试错成本适配全新未知任务,真正拥有类人的自适应学习能力。

没有持续学习,所有Agent、RL的能力都是无根之木,永远无法突破工具型AI的天花板,自我迭代与通用智能更是无从谈起。


模型自我迭代:渐进式奇点,无突变式智能爆炸

仅当持续学习机制成熟后,AI才能进入自我迭代阶段,也就是行业所说的渐进式奇点。梁文锋的观点是,AGI的迭代是渐进而非突变,不存在某一天规模阈值突破后突然诞生超级智能的情况。

传统静态AI参与模型研发,只是人类使用AI作为工具;而具备持续学习能力的AGI,能够自主复盘实验失败、优化训练策略、迭代模型架构、修正算法缺陷,自主参与自身的升级迭代。这种迭代能力会持续加速AI的进化速度,形成正向循环,但整个过程是连续、渐进、可控的,而非突发性智能爆炸。

具身智能:AGI成熟后的落地载体,而非前置条件

与行业多数观点不同,梁文锋将具身智能放在AGI路线的最后一步,核心逻辑并非否定具身智能的价值,而是明确认知智能优先于物理智能

具身智能引入了物理硬件、运动控制、视觉传感、环境动力学等海量额外工程复杂度。如果模型尚未解决持续学习、元学习的认知内核问题,即便接入物理躯体,依旧是静态VLA模型,只能在实验室数据集表现优异,无法在真实物理世界持续进化。


正确的技术路径是:先在纯软件信息空间跑通“持续学习+自我迭代”的通用认知机制,打造成熟的AGI内核,再将该认知体系迁移到物理载体,最终实现真正的具身通用智能。

AGI研发的主次关系

综合两位执行业牛耳者的观点,可以尝试定义各核心技术的层级与边界,明确AGI研发的核心优先级:

  • 预训练+离线RL:基础能力底座,负责知识储备、行为对齐、推理强化,是必要但非充分条件,堆规模无法抵达AGI;

  • CoT+Agent:应用层能力升级,实现推理精细化、任务主动化,属于工具能力优化,无智能生长机制;

  • 持续学习+元学习:AGI核心底层机制,解决开放世界泛化、在线进化、小样本自适应问题,是通往AGI的唯一核心突破口;

  • 自我迭代:持续学习成熟后的能力结果,实现AI自主进化的渐进奇点;

  • 具身智能:AGI认知内核成熟后的终极落地形态。


结语:AGI的终局逻辑,很可能是从拟合数据到自主成长

过去十年,AI的进步依赖于对人类已有数据、知识、行为的极致拟合;未来的AGI竞赛,核心是打造 类人的自主学习与进化机制

Jerry Tworek反思了规模崇拜的神话,阐述离线RL的范式天花板;梁文锋则给出了一条渐进的落地路线,并坚信持续学习、元学习是跨越工具AI与AGI鸿沟的核心钥匙。

通往AGI的道路,从来不是无限堆算力、堆数据的简单工程叠加,而是一场底层智能架构的革命。当模型终于摆脱静态冻结的桎梏,拥有持续学习、自适应、自我迭代的原生能力,真正的通用人工智能,可能才会真正到来。


参考链接

https://www.youtube.com/watch?v=2RJiaf0SY8s