论文导读

大模型的工作空间里住着什么:寄存器,不是计划

2026年7月18日

论文导读(BlackboxNLP 在审):在开源模型上独立复现「全局工作空间」主张。用模型自己的下一词分布过滤后,可因果操纵的只剩上下文寄存器,内容计划跌到置换基线。

Anthropic 的可解释性研究提出过一个引人注目的主张:语言模型内部存在一个「全局工作空间」,模型在开口之前就把一些内容放在了那里,包括押韵词这类还没写到的东西。这个主张能在开源模型上复现吗?如果能,放在里面的到底是什么?

论文说了什么

这项工作在开源权重模型上做独立复现,方法上加了一道关键过滤。

用 lens 从中间层读出内容时,一个绕不开的混淆是:读出来的东西可能只是解码器已经收敛的结果,也就是模型马上就要说出口的词。这种情况下所谓「工作空间」不过是提前看到了输出,谈不上内部计算。过滤的做法是看「嘴边排名」,即该词在模型真实的下一词分布里排第几。排得靠前的判为影子,是输出的预告;只有排得足够靠后、模型当下并不打算说出来的,才算隐蔽内容,才有资格支撑工作空间的主张。

加上这道过滤,工作空间被劈成了两半。

留下来的一半是上下文寄存器:对话正在使用的哪种语言、被打错的字底下原本想写的是哪个词。这类是关于上下文本身的状态,条件着后续一切生成。跌到置换基线的一半是内容计划:押韵词、心算的中间值、多跳联想。把隐蔽性阈值调高,这些前瞻性内容就死了,说明它们反映的是输出预期,不是真正的内部计算。

寄存器可以被因果操纵。编辑语言寄存器能在 91.1% 的 prompt 上翻转输出语言,其中 64.6% 是完整翻转,即语言变了、答案还对;但只看严格隐蔽的子集,完整翻转掉到 29.2%,说明寄存器携带的是语言这个设定,不是内容本身。抹掉错字轴则干净地废掉了模型的纠错能力。还有一个值得停一下的细节:通过实体编辑改写寄存器,会连带改写模型对「自己被问了什么」的表征,这在 59% 到 71% 的试验里出现,且在 1.7B 到 14B 的尺度阶梯上稳定。

这篇的证据强度

对照做得比较硬。置换基线给出随机水平的地板,等幅随机方向的对照排除了「随便扰动都会有效果」这种解释。跨尺度用了 Qwen3 的 1.7B、4B、8B、14B 四档,跨架构另测了 Gemma-2-2B,结论在两个模型族上都成立。这些是复现类工作该有的样子。

最值得注意的限制是作者自己点出的:可读出的这条通道是一个拟合出来的性质,而且带宽很窄。有效维度分析显示,被搬运的方向从 75 到 128 维塌缩到只有 2 到 12 维,旗舰演示里大约就是两维。这意味着「能读出、能编辑」不等于模型内部真有一块内容丰富的黑板,更可能是我们拟合出了一条极细的可及通道。把它当成模型内部表征的全貌会读过头。

另外,否定性结论的分量取决于阈值。内容计划是在隐蔽性阈值调高后才跌到基线的,阈值定在哪里是方法选择而非自然事实。这一点论文透明地呈现了阈值扫描,读者可以自己判断,但它确实意味着结论的强度与阈值绑定。

对实践的意义

企业客户常问「模型内部到底记住了什么、哪些行为可控」。这类工作给的不是哲学答案而是操作答案:哪些内部状态可以被读出、被编辑、被信任。

落到交付上有一条具体的划线。语言、格式、被纠正过的用词这类上下文设定,是可以在内部被稳定持有并干预的,围绕它们做行为约束有依据。而「模型已经在心里打好了草稿」这类假设不成立,指望通过读取内部状态提前预判模型将要给出的实质内容,目前没有证据支持。可解释性能给的信任边界,比很多人期待的要窄。

延伸阅读