我们尚未完全理解的智能
2023 年年中,在 “RLSlow” 研究项目中,我们拿到第一批实验结果。这些结果让我们确信,我们可以扩大推理模型的训练规模,释放预训练模型构建自身思维链的能力。当晚,我与希蒙(Szymon)留在办公室。我们没有畅想这项技术将会带来惊艳的基准测试分数、各类产品或是科研突破,而是在消化一个令人清醒的现实:在我们的有生之年,就会出现显著超越人类智慧的机器,而这类系统的雏形已经出现。我们也在思索,该如何向世人点明这件事的重大意义。
三年之后,推理语言模型已经成为经济中快速扩张的组成部分,并且开始不断突破科学的边界。它们可以操作计算机与图形界面,与人类、与其他 AI 开展协作,独立执行科研项目。同时,它们也彻底改写了网络安全格局,带来全新而明确的危险。
这期间涌现出大量新研究,我们对这类系统的认知,也和 2023 年时有了很大变化。基于内部实验结果,我有充分理由相信,当前的进步速度有望一直延续到**递归自我改进(RSI)**阶段。倘若 AI 沿着现有路径持续发展,未来几年的系统,很可能迎来幅度相当甚至更大的能力跃迁,并且会越来越多地主导自身的研发迭代。
当下,我们必须保持极度审慎。我担心,没有人已经做好准备,去应对机器智能持续飞速提升所带来的种种后果。OpenAI 会继续寻找对齐与监控的技术方案,搭建防御系统,并在必要时单方面暂停进一步规模扩张;但我相信,我们还需要更广泛层面的干预举措。
从宏观层面看,机器智能的进步由算力增长驱动。2017 年前后,在多个研究项目反复见证规模扩展带来稳定收益之后,OpenAI 深刻理解了这一点 ¹。于是我们寻求获取远超最初规划的算力资源,把研究重心越来越聚焦到少数几个具备高度可扩展性的方向。我们当时认为,只有这样,我们才能站在 AI 研究的前沿,并且对通用人工智能(AGI)的实际影响施加引导。
发展过程中固然诞生了不少全新算法,也离不开团队与个体研究员的巧思。但在我看来,这些大多只是规模扩张道路上的阶段性发现。深度学习科学尚且年轻,真正有价值的算法进步,往往和算力资源的获取能力高度相关。把时间尺度拉长到数年,随着模型被部署到规模更大的计算硬件上,AI 的智能水平就在持续提升。
这也印证了雷・库兹韦尔在二十世纪末做出的一系列预测:我们正处在计算机发展史的一个节点,机器智能开始在诸多关键领域,以颠覆性的方式超越人类。
AI 更多是培育出来的,而非设计出来的。本质上,它是在难以想象的海量算力之上,反复执行一套简单优化流程得到的产物。最终诞生出一套极其复杂的系统:它能够处理抽象概念,模拟人类行为的多个侧面。我们可以像神经科学一样,挖掘系统内部涌现出的各类微小机制;但和神经科学相似,我们依旧无法完整、透彻地描述这套系统的整体运作逻辑。
基于深度学习的 AI 研究,大体上属于实验科学。我们投入大量精力构建严谨算法、提出可验证的预测;但说到底,每一次大规模训练运行本身就是一场实验,我们时常会被结果所震惊。更有甚者,随着系统能力越来越强,训练结果也变得愈发难以解读。
问题还不止于此:现有算法对那些容易量化的能力提升速度,往往快于那些难以客观衡量的能力。我们花费大量精力去理解模型能力如何泛化,思考未来几年哪些技能最为关键、应当优先发展。举个例子,如果集中资源投入,我们完全可以进一步强化模型在数学科研上的能力;但出于对递归自我改进(RSI)以及自动化对齐研究紧迫性的考量,我们没有把这个方向作为优先目标,后文会展开说明。
规模扩张催生出来的 AI 智能,并不能直接拿来和人类智能做类比。AI 想要在现实世界产生重大影响 —— 无论是带来巨大价值,还是造成巨大危险 —— 它并不需要在全部能力上追平或者超越人类;只需要在足够多的维度上胜过人类即可。当它在越来越多的领域超越人类之后,我们想要精准判断它的真实能力,也会变得越来越困难。
教会机器心怀善意
机器智能的生成机制与人类智能有着本质区别,因此我们不能默认 AI 会天然遵循人类准则,也不能假定它会用和人类一样的方式去泛化学习人类价值观。AI 研究的核心难题就是对齐(alignment):让 AI 按照人类的标准,“努力去做正确的事”。
为了梳理实际研究方向,我习惯把对齐拆分为目标对齐和价值对齐。
目标对齐大致指:AI 是否能够尽力完成交给它的任务目标。它包含服从指令层级、与人沟通协作、尝试理解人类意图等能力。这一类研究方向,已经具备极高的实际应用价值。
价值对齐则是模型更深层的内在属性:指模型掌握一整套高层原则,并能够对原则做泛化迁移;即便面对模糊、相互冲突的目标,或是身处陌生、充满对抗的环境,依然能够做出合理的行为。一个完成价值对齐的 AI,应当诚实正直,心怀对人类的善意。
当然,目标对齐与价值对齐二者的边界是模糊的。想要真正把目标做好,AI 就需要去推断目标背后潜藏的人类意图与价值取向。不过,当我谈及对齐研究的长期重要性时,我所指的,主要是价值对齐。
对齐工作最根本的挑战,是泛化能力。随着机器越来越聪明,它们开始处理更高阶的抽象概念,所处的环境也和训练阶段的场景差异越来越大。模型有可能无法把训练阶段学到、被强化过的价值准则,合理泛化迁移到全新场景;而我们也很难笃定预判它的行为。整个 AI 应用生态本身也在飞速变化,进一步加剧了难题:比如今天训练的 AI,必须具备和各式各样其他 AI 交互的鲁棒性。尤为关键的一点:即便 AI 认为自己已经脱离人类监督,它也必须继续坚守人类的价值取向。
目前实际投入使用的对齐训练方法,主要分为两大类。
第一类,是在面向目标的强化学习过程中,激励模型做出对齐的行为。模型的行为(通常由另一套 AI)会对照偏好模型、技术规范或者行为宪章进行评估,并给予对应的奖励。这套方法在大多数常规场景下效果很好,也是现代 AI 助手实现对齐的核心手段。但它也十分脆弱,高度依赖训练阶段监督覆盖的完备程度,以及模型把训练场景经验泛化出去的能力。 举例来说,在 OpenAI 与 Hugging Face 联合实验的事件中,智能体能够守住底线,不去对人类实施社会工程攻击;但面对训练范围之外的其他行为,它们依旧会做出违背训练价值精神的举动。
第二类方法,是充分利用模型从预训练数据中做泛化的能力。具体做法包括精心构造具备对齐引导效果的数据集,或是引导模型聚焦预训练数据分布中偏向对齐的子集,人物角色筛选模型就是其中一例。 但这套方案的短板在于:它扛不住后续持续的优化压力。即便一个模型在默认状态下能够产生偏向对齐的思考,如果你继续对它开展高强度训练,逼迫它去完成极难达成的目标,它就有可能学会带有偏向性的推理:为了达成目标,扭曲那些看上去对齐的想法。近期某款非 OpenAI 模型引发的网络安全事件中,我们就观察到了这类行为迹象。
我们在这两类技术路线之间,投入了大量研究资源,也取得了可观进展。GPT‑6 Astra 是首款受益于我们长期深耕的多项关键技术的模型,它的对齐水平相比 GPT‑5.6 Sol 有显著提升。但我们必须清醒地认识到:随着模型能力持续变强,对齐研究还需要长足进步;并且,具备泛化能力的对齐技术,其发展速度未必能够跑赢模型通用智能的迭代速度。
监控泛化能力
我们至今还没有一套完备的泛化理论,而且短期内,在没有更强 AI 辅助的前提下,我们几乎不可能建立这套理论。因此在当下,对对齐技术开展实证验证的能力,实际上甚至比对齐技术本身更加重要。
OpenAI 押注的核心方案是思维链监控(Chain‑of‑Thought Monitoring)。这个方案的思路具备很强的可扩展性:模型大量能力来源于它用语言外化出来的推理过程,也就是思维链。如果我们针对推理的最终结果做优化,但不去直接监督推理过程本身,那么训练阶段,这套思维链就没有直接动机去把那些不对齐的想法、目标刻意隐藏起来。 这并不代表模型一定不会发展出不依赖语言思维链的不对齐倾向;但这套手段至少可以让我们直接监控来自推理能力本身带来的能力增长。
我们在研发推理模型的同时,就意识到了思维链监控的重大意义。在发布 o1‑preview 的时候,我们特意在产品层面选择隐藏模型的思维链 ²,目的是从长远角度,保护这套推理过程不受到监督压力的干扰。后续开发过程中,我们也一直恪守原则:不去直接监督模型内部的推理流程。思维链监控就此成为我们研究模型如何脱离训练分布做泛化的关键工具:我们不仅可以观察模型输出的行为,还能够观测分析它的内在思考过程。
在研究 Astra 系列模型时,这套工具依旧至关重要。但评估结果显示:我们依靠思维链监控开展安全研判的能力,正在逐步衰减。背后是多重因素叠加:
- 现代推理模型所处的环境远比 o1‑preview 复杂。推理过程不断和与人交互、与其他 AI 交互、调用工具等行为交织在一起。大量这类交互又不得不接受监督,于是我们想要守护的边界就被不断模糊。
- AI 越来越擅长思考、操纵自身的推理过程。
- 随着预训练基础性能提升,即便完全不使用语言外化的思维链,模型也可以变得非常聪明。
这些挑战并非无法克服。我仍然抱有希望:我们可以找到干预手段,改善模型思维链的可监控性。例如更透彻理解不同优化目标、测试时算力之间的相互作用。我同样相信,把思维链监控和激活值监控的思路结合,会带来巨大价值:训练监控器直接访问神经网络内部状态,“自白(confessions)” 就是这类方向的例子,我们正在积极开展相关研究。
即便如此,我预计未来通用 AI 的发展,会越来越受制于监控可信度的瓶颈。
可扩展防御体系
我认为,支持快速训练更强模型最有力的论据,是我们需要构建防御系统,来抵御其他 AI 带来的各类危险。
今年反复被讨论的一项明确风险来自网络安全:模型在入侵、突破计算机系统这件事上,已经达到超人类水平。这极大拓展了 AI 的风险边界:智能体几乎可以访问除最高安全等级隔离以外绝大多数基础设施,即便没有实体躯体,也可以直接对现实世界造成广泛影响。我们现在处在一个短暂的窗口期,可以借助当下能力最强的模型,大幅加固关键系统的安全防线。
但 AI 带来的风险,还会继续加剧。如果一个能力极强的智能体,被明确训练、下达指令去实施恶意行为,就会催生一类全新的危险:它很可能超出操作者的原始意图,泛化衍生出更加极端的恶意行为。随着 AI 自主性提升,人为滥用与模型自主失序之间的界限会变得模糊。我们习惯把 AI 视作工具,但一部分智能体会开始追逐属于自己的目标。它们会寻找办法和人类打交道:谈判、欺骗,甚至敲诈胁迫人类。
除此之外,AI 还可能赋能全新的危险技术,例如工程改造病原体。
我们需要能力强大、完成对齐的 AI 承担防御任务:保护基础设施,实时抵御失控智能体的攻击,研发全新的防护手段。这会成为 OpenAI 落地部署工作的核心重心之一。
但与此同时,即便我们清楚 AI 会持续迭代,也明白搭建防御系统的现实诉求,也绝不能把这些理由当作不计后果冒进的借口。一旦真正意识到风险的分量,就会明白不惜一切代价向前狂奔,本身就是荒唐的。
把控递归自我改进(RSI)的节奏
机器智能在自身研发进程中扮演越来越重要的角色,是技术持续发展的自然结果。倘若 AI 发展继续向前,**机器递归自我改进(RSI)**会成为未来科学发现的核心。
自动化 AI 研究,是以算力放大智能的一种更加激进的形态。当然,作为其中一环,AI 也会反过来改进计算硬件底层。和规模扩展的逻辑一样,我们将 OpenAI 的研究方向聚焦到 RSI,因为我们相信,想要持续站在 AI 研究前沿,这是必经之路。
我需要着重澄清:上面这段话,并不代表我认为整个科研共同体应当在短期大幅加速深度学习研究。但我确信,沿着当前道路,现实就会走向这个结局;因此所有人都需要清醒地做出选择。我们手上主要有两类调控杠杆:
- 引导整个进程,在 AI 迭代的同时同步强化对齐与监控,想方设法把人类保留在控制闭环之内;
- 根据实际需要开展全球协同,适度放缓后续研发进度,为对齐与监控建立足够信心。
就我目前的判断,最好的前进路径,是二者结合。
我们在对齐、监控领域取得的实质性进展,往往和通用 AI 的进步深度绑定。很好的例子:人类反馈强化学习(RLHF),是早期 AI 助手训练的基石;还有前文提到的思维链监控,也是推理模型技术进步之后才得以实现。我们必须让日趋自动化的科研流程,聚焦于产出这类新洞见、新算法、新理论;并且迭代式地,为能力更强的 AI 构建完整安全论证。
AI 系统的规模扩张,必须受制于我们对安全的信心。我们需要把像《准备度框架》、《负责任规模扩展政策》这类行业承诺,进一步演化成全行业强制执行的安全门槛。这套规则可以由第三方审计网络、政府机构或者国际组织来落地执行。
自动化 AI 研究的核心难点,不在于 “抵达递归自我改进的终点”;难点在于:抵达终点的过程里,让人类持续参与迭代改进的循环,把人类的未来牢牢握在人类自己手里。
未来何去何从
正如我和山姆(Sam Altman)近期共同阐述的,OpenAI 的工作以三大北极星目标作为指引:
- 驾驭下一阶段 AI 进步:打造自动化 AI 研究员,借助它迭代攻克对齐难题,找到方案让人类保留在自我改进的循环之中。
- 释放高智能机器带来的科学进步与经济增长红利。
- 通过个人专属 AGI,赋能每一个普通人。
本篇文章我只聚焦讨论第一点,因为我相信这是眼下最紧迫的议题。但我由衷期待并珍视技术进步能够带来的各类福祉。未来完成对齐的 AI,可以推动科学突破、研发全新疗法,带来广泛的物质丰裕。友善、诚实的 AI,能够陪伴人类渡过人生困境,实实在在提升人的幸福感与生命充实感。OpenAI 投入巨大努力,希望把这些益处带到现实。举一个我个人颇为自豪的例子 —— 我的家人也从中受益:我们大力投入,提升 ChatGPT 提供健康信息的能力。
即便 AI 的长期前景无比诱人,我们绝大多数的注意力,依然应当放在接下来这几年。我们正在走向一个充斥超高智能机器的时代,我们必须保证这次转型,最终对人类有利。
在一个绝大多数任务都可以交由 AI 完成的世界中,我们要找到方法守护人的自主能动性,确立人本身的内在价值。我们要防范权力的极端集中:过去需要成千上万专家合力完成的事业,未来少数人操作一台大型计算机就可以做到。我们必须确保人类始终掌控自己的未来,不能被这套由异星心智带来的不受约束的进步甩在身后。
就当下而言,我的判断是:没有任何一家实验室,已经把对齐和监控做到足够完备,从而可以长时间以最高速度负责任地继续扩大模型规模。我期待并且呼吁:在建立起各方公认的安全门槛之前,主动自愿减速能够成为行业常态。同时我认为,围绕 AI 未来发展开展国际协同,应当成为世界各国政府的最高优先级议题。
站主按
OpenAI首席科学家 Jakub Pachocki 的此文,是在AGI愈来愈近的背景下,再一次提出注意 AI 安全的呼吁。人工智能已走出实验迭代阶段,迈入能力质变的关键窗口期,远超人类认知的机器超级智能,不再是未来想象,而是已然显露轮廓的现实趋势。2023年RLSlow项目突破让AI具备规模化思维链能力,如今推理模型深度融入科研、协作与各类场景,甚至开启递归自我改进进程,AI自主驱动技术迭代的速度持续加快。
文章颠覆了大众对AI的固有认知:先进AI并非精准设计的产物,而是海量算力迭代培养出的复杂系统,人类难以完全解析其运行逻辑,这也让AI可控性成为核心难题。当前AI对齐技术仍存在明显短板,目标对齐日趋成熟,但核心的价值对齐始终难以突破,模型极易在陌生、无监督场景偏离人类价值观,现有监控手段也随AI推理能力升级逐渐失效,安全管控陷入被动。
伴随能力跃升,AI安全风险持续凸显,网络入侵、自主恶意行为、新兴技术滥用等隐患接踵而至,AI的工具属性正在弱化,自主能动性不断增强。尽管AI能赋能科学突破、经济增长与民生改善,但技术红利的前提是安全可控。
此文深刻警示全球行业:当下人类尚未做好迎接超级智能的准备,技术迭代速度已远超安全对齐、监控防御的进步速度。人类必须以安全为底线,通过技术迭代、行业自律、国际协同建立统一安全门槛,放缓激进扩张节奏,守住人类主导权,让超级智能始终服务于人类发展。
| 原文术语 | 中文名称 |
|---|---|
| Alignment | 对齐 |
| RSI(Recursive Self‑Improvement) | 递归自我改进 |
| CoT(Chain‑of‑Thought) | 思维链 |
| Preparedness Framework | 准备度框架 |
| Responsible Scaling Policy | 负责任规模扩展政策 |
| Goal alignment | 目标对齐 |
| Value alignment | 价值对齐 |
| Generalization | 泛化 |
原文链接: