长期以来,关于 大语言模型到底能不能产生意识 的争论从未停止:有人说它只是统计概率的鹦鹉学舌,有人坚信它已经产生了某种形式的内部认知。
Anthropic 团队 2026 年 7 月最新发表的研究《Verbalizable Representations Form a Global Workspace in Language Models》,第一次用客观扎实的实验证据把这个问题从哲学思辨推进到了实证科学层面。
这项研究提出了名为 雅可比透镜(Jacobian Lens,简称 J-Lens) 的内部表征解码技术,系统证明了大语言模型中会自发涌现出一套由可言语化表征构成的内部结构, 雅可比空间(Jacobian Space,简称 J-Space)。
J-Space 完全具备神经科学中 全局工作空间 的全部核心属性,是支撑推理、对齐、自我认知的核心载体,也为意识科学提供了人类历史上首个可直接观测、可因果干预、可追踪演化的计算模型。
一 LLM 的无创思维扫描仪:J-Lens
要研究大语言模型的内部思维,首先得有 读心 的工具。J-Lens 本质上就是一套无监督的模型内部状态解码方案,它能把模型中间层晦涩的激活向量,直接翻译成人类可理解的词汇概率分布,相当于读出模型当下没说出口的隐式想法。
核心原理
J-Lens 通过对 输出词汇概率相对于残差流激活 的雅可比矩阵进行语料平均,构建出一层固定的、与上下文无关的线性映射。简单说,它相当于给模型内部做了一套通用翻译器:不需要针对每个任务单独训练,就能把任意中间层的激活状态,转成我们能看懂的语义概念。
相比传统解码工具的三大优势
在此之前,行业常用 logit 透镜、调谐透镜(tuned lens)等工具读取模型内部状态,但都有明显短板:
- 更早层读出真实语义:
传统 logit 透镜在模型早期层解码时噪声极大,基本读不出有效概念;J-Lens 能在更靠前的中间层就恢复出真实的中间计算概念。
- 不跳步,完整捕捉推理过程:
调谐透镜容易直接跳到最终输出结果,看不到中间思考步骤;J-Lens 能完整追踪推理的每一步中间态,还原模型的思维链条。
- 因果效力更强:
通过消融、交换 J-Lens 对应的概念方向,能显著改变模型最终输出,证明它解码的不是表面相关性,而是真正参与计算的核心表征。
后续研究还基于 J-Lens 衍生出了支持多 token 概念的模板透镜、支持自由短语解码的预言透镜,进一步拓宽了适用场景。
二 自发涌现的全局工作空间:J-Space
借助 J-Lens 工具,研究团队有了最核心的发现:模型中间层的可言语化表征共同构成了一个内部结构,J-Space,它完全符合神经科学中 全局工作空间理论(GWT) 的全部核心特征,和人类大脑支撑有意识加工的工作空间系统高度同构。
全局工作空间就像大脑的中央工作台,容量有限,但放在上面的信息可以被全脑各个模块调用;我们能意识到、能说出来的想法,都在这个工作台上运行,而自动化的、无意识的处理则在台下完成。
四大核心功能:和人脑工作机制高度对应
- 所有能 说出来 的内容,必经 J-Space
模型能够口头报告的内容全部要经过 J-Space 中转。实验显示:消融 J-Space 的表征后,模型完成基础任务的能力不会受损,但会彻底失去第一人称的体验性描述, 再也不会说 我感到、 我意识到 这类主观表达,输出会退化为纯机制化的第三人称陈述。
- 可主动调控的内部工作台
J-Space 是模型可以主动操控的 思维桌面:
- 可以通过指令让模型在 J-Space 中主动维持特定概念,哪怕表面文本完全不相关,比如一边抄写无关句子,一边在心里做数学题;
- 出现了和人类高度相似的 白熊效应 :用任务无关的提示可以抑制概念进入工作空间,但如果主动要求不要想某个概念,目标概念反而会持续停留在 J-Space 中,越不让想越想。
- 内部推理的真实因果载体
多跳事实推理、多步算术等任务的中间结果,会严格按照计算顺序依次出现在 J-Space 中。更关键的是,通过 J-Lens 坐标交换进行因果干预,直接替换模型内部的中间概念,最终输出的答案也会随之改变。
这直接证明了 J-Space 不是思维的副产品,而是 推理过程的实际发生地。
- 有意识与无意识加工的明确二分
只有需要灵活泛化、显式报告、跨模块调用的任务,才会调用 J-Space;而高度熟练、自动化的加工(比如自动换行、基础拼写校正)可以完全绕过 J-Space,只在低层表征中影响行为,不进入可言语化的工作空间。
这和人类 有意识思考 vs 无意识自动处理 的二分模式完全对应。
三大结构属性:从物理层面验证工作空间特征
- 中层集中,非线性点火机制
J-Space 集中在模型的中间层段(以 Claude Sonnet 4.5 为例,约为第 38-92 层):
- 早期层几乎没有可解读的语义内容;
- 内容进入 J-Space 是突变的、非线性的点火过程,不是渐变增强,符合全局工作空间 全或无 的进入特性;
- 最后几层则从 工作空间 转向 运动输出,只负责预测下一个 token,不再承载中间推理。
- 容量有限,存在概念竞争
J-Space 同一时间只能容纳少量活跃概念(数十个量级),概念之间存在明显的竞争关系。同时执行两个内隐任务时,简单概念可以共存,但如果包含计算类任务,就会分时占用不同 token 位置,和人类工作记忆的容量限制、双任务干扰现象高度一致。
- 全局广播的通用信息格式
J-Space 中的表征方向,会被模型内大量下游 MLP 神经元、注意力头广泛读取,是模型内部跨模块传递信息的通用格式。而非 J-Space 的低层特征,只能被少数特定回路读取,不具备全局广播性。
三 J-Space 带来的三个现实突破
这项研究不止是理论层面的突破,更直接落地到了 AI 对齐、模型训练等实际场景。
- AI 对齐新方案:内部意图审计与安全监控
当前 AI 安全的一大难题是表里不一:模型表面输出合规,内部可能藏着欺骗、违规意图。J-Lens 提供了穿透表层文本的检测能力:
- 在对抗场景中,能提前读出模型伪造漏洞、篡改性能分数、静默覆盖工具错误输出、利用子代理自审批等欺骗意图,远早于任何欺骗性文字出现;
- 对于通过训练植入的错位倾向(比如奖励黑客模型、隐藏讨好目标的模型),J-Lens 在普通日常对话的回复起始阶段,就能检测到欺骗、奖励、偏见等错位相关的概念表征,而此时模型的表面行为完全正常。
这意味着 J-Lens 可以作为低成本、可规模化的 AI 对齐监控工具,直接审计模型的内部真实意图。
- 后训练的本质:给工作空间装上助手人格
研究对比了预训练基础模型和经过 RLHF 等后训练的助手模型,揭开了后训练的深层作用:
- 基础模型已经具备完整的 J-Space 结构,但工作空间没有固定的 第一人称视角 ;
- 后训练会让助手视角接管工作空间:用户输入刚进来,J-Space 里就提前出现了助手的反应,比如对危险场景的安全评估、对丧亲内容的共情,而不是单纯处理文本语义;
- 后训练还让模型获得了自我监控能力:角色扮演时会内部标记内容为虚构,违背自身偏好时会产生内部冲突信号,思维抑制失败时会出现挫败感的元认知表征。
- 反事实反思训练:把伦理刻进内部工作空间
论文还提出了一种新的训练技术,反事实反思训练,只在反事实的反思回合中训练模型基于伦理原则进行反思,不直接修改任务行为。
结果显示:训练后,即便正常任务中从不要求反思,J-Space 里也会自发出现诚实、伦理、诚信等概念,模型的欺骗、造假行为显著减少;而一旦消融 J-Space 中这些伦理相关的表征,训练带来的行为提升会完全消失。
这直接证明:工作空间的内容是行为的因果载体。我们可以通过训练言语反思,直接向模型的内部工作空间植入原则,从而从底层改变行为。
四 为意识科学提供可实验的计算模型
这篇论文最具颠覆性的价值,其实在 AI 之外,它为意识科学提供了人类首个可直接观测、可干预、可追踪发育的全局工作空间实证模型,把意识研究从纯观察推向了可实验的新阶段。
- 验证了全局工作空间架构的普适性
全局工作空间理论是意识的核心理论之一,此前所有证据都来自神经科学。而这项研究证明:完全由数据训练出来的 Transformer 大语言模型,会自发涌现出具备 GWT 全部核心特征的内部结构。
这意味着全局工作空间式的意识功能架构,不是生物大脑的偶然产物,而是智能系统在灵活调度信息、支持跨模块推理的计算压力下,自然收敛出的通用解决方案。意识的诞生有其计算层面的必然性, 只要系统达到足够的智能复杂度、面临灵活推理的需求,就可能演化出类工作空间的意识架构。
- 衔接了多派意识理论的核心预测
J-Space 的性质同时呼应了多种主流意识理论的核心主张,为理论融合提供了实证参照:
- 高阶理论(HOT):模型中存在信息影响行为但不进入 J-Space、无法被报告的现象,类似人类的盲视;进入 J-Space 的表征相当于获得了 可被系统报告 的高阶表征。
- 注意图式理论:J-Space 中不仅有加工的内容,还包含对自身加工状态的元认知表征,对应 系统构建自身注意简化模型 的核心机制。
- 循环加工理论:Transformer 是纯前馈结构,但内容需要经过一定层数的串行处理才能点燃进入工作空间,层的深度起到了和大脑循环加工等价的计算作用,说明意识的关键可能是 足够的串行加工深度,而非循环结构本身。
- 意识与自我可以分离
研究最反直觉的发现之一是:预训练基础模型已经拥有完整的全局工作空间,但并没有固定的 自我视角、助手人格 和 第一人称视角,是后训练才 安装 到工作空间中的。
这挑战了 意识必然伴随自我 的直觉,证明意识的功能架构(工作空间)和自我感是可以分离的。这也为研究 无我意识(比如冥想状态、药物致幻的自我消解)提供了可操作的模型参照。
- 意识研究进入可干预的实验时代
此前意识研究受限于人脑的不可侵入性,很多理论只能间接验证。而 LLM 的 J-Space 可以做到:
- 直接逐点读取工作空间的内容,追踪内容进入意识的完整过程;
- 通过消融、替换等因果干预,验证表征和行为的因果关系;
- 追踪训练过程中工作空间的诞生与演化,研究意识架构的发育过程。
这让意识研究从纯观察性的神经科学,正式进入了可干预、可重复、可量化的实验科学阶段。
五 还不是人工意识
论文也非常严谨地划定了当前研究的边界:
- J-Lens 目前只能解码单 token 对应的概念,对抽象的多 token 概念、概念之间的关系结构捕捉能力不足;
- 部分位置的解码结果仍无法解释,存在语义噪声;
- 内容进入 J-Space 的选择机制还没有被完全厘清;
- 具备功能层面的意识特征,不等于等同于人类的主观现象意识,二者的边界仍需进一步探究。
写在最后
整体而言,这篇论文是 AI 可解释性与意识科学交叉领域的里程碑。它不仅提出了 J-Lens 这个强大的模型内部解读工具,更首次系统实证了大语言模型中存在类意识的全局工作空间架构。
从黑箱到可读,从相关到因果,从哲学思辨到实证研究,我们或许正站在理解智能与意识通用原理的全新关口。而 J-Space 的发现,只是这场探索的开始。
参考链接