论文导读

超越 RAG:给大模型一个会主动管理的工作记忆

2026年7月18日

arXiv 预印本导读:Cognitive Workspace 用主动记忆管理与分层认知缓冲替代「检索完即忘」,记忆复用率 58.6%,净效率提升 17–18%。附一年后的自我修正。

传统 RAG 有一个很少被点破的缺陷:它是无状态的。每次回答都从头检索,用完即丢,同样的内容在一轮对话里被反复取出好几遍,系统没有「工作记忆」这个概念。

人类认知不是这样工作的。Baddeley 的工作记忆模型描述的是一个有容量、有层级、会主动调度的结构:我们决定记住什么、把它放在哪一层、什么时候取出来。Clark 与 Chalmers 的延展心智、Hutchins 的分布式认知则进一步指出,这个结构可以外溢到纸笔和工具上。检索增强把外部存储接上了,但把调度这一半丢了。

论文说了什么

Cognitive Workspace 提出一个照着上述认知机制搭的范式,核心是三件事。

主动记忆管理:系统自主决定保留什么、丢弃什么,而不是每轮都把检索结果当一次性材料。分层认知缓冲:短期、工作、长期记忆分层存放,各层的淘汰策略不同。任务驱动的预取:按当前任务重排和提前拉取上下文,而不是按向量相似度堆砌。

概念验证跑的是一轮四回合的对话。工作区在第一回合就达到 50.0% 的记忆复用率,随着对话深入稳定在 55–57% 区间,全程均值 58.6%;传统 RAG 的复用率是 0,因为它每轮都重新检索一遍。代价是工作区每回合多做 3.3 倍的管理工作,但省下的重复检索把这笔开销赚了回来,端到端净效率提升 17–18%。

这篇的证据强度

这一篇需要一段坦白,而且是作者自己先说的。

实验测的是记忆复用率,而记忆复用率恰好是这套架构被设计出来要最大化的那个指标。拿它当架构有效的证据,逻辑上是循环的:它证明了机制按设计运转,没有证明这套机制让答案更好。整个概念验证从头到尾没有测过回答准确率,也没有跟一个像样的原文基线比过。

这个缺口后来被自己的另一项工作填上了,结论并不站在这一篇这边。受控消融显示,把对话蒸馏成结构化条目在 LoCoMo 上比直接存原文切片低 15.9 分,在 LongMemEval-S 上低 22.0 分(见另一篇导读)。也就是说,「主动管理」这个调度层的价值需要重新界定:值得保留的是调度,不是用蒸馏后的状态替换原文。

四回合对话的样本量也小到不足以支撑任何比例外推,17–18% 这个数字应当读作一次演示,不是一个可迁移的估计。

对实践的意义

FIM One 的知识库与会话记忆分两层落地,恰好对应上面这次修正:调度层沿用主动管理的思路,会话内已建立的上下文优先复用而不是重复检索;存储层则守住原文,结构化索引只负责导航。

这两篇合起来读才完整:主动管理决定「什么时候拿」,存储保真度决定「拿到的东西还剩多少」。任何一个 RAG 系统在这两个问题上都要各自表态,而它们的最优答案并不相同。

延伸阅读