← 返回首页

思考即回忆:推理如何解锁 LLM 的参数化知识

2026-06-25 LLM Chain-of-Thought 参数化知识 Google Research

CoT 推理能提升复杂任务表现,这早有共识。但一个反直觉的问题是:对于简单的事实回忆,推理也能帮忙吗?模型要么知道某个事实,要么不知道——不需要数学推导,不需要多步逻辑。Google Research 这篇论文用严格的受控实验回答了这个问题。

参数化知识的边界

先用 pass@k 测量模型的参数化回忆边界:检查多个采样中是否存在正确答案,而非只看 top-1。实验在 Gemini-2.5(Flash 和 Pro)和 Qwen3-32B 上高度一致——开启推理后,那些推理关闭时几乎无法恢复的答案被成功召回。而这不是因为问题复杂,数据集里绝大多数都是单跳简单问题。

pass@k curves
Figure 1: pass@k 曲线。推理开启(ON)后,正确答案在更少的采样次数内就能被召回。
reasoning effectiveness omega
Figure 2: 推理有效性指标 Ω。在所有模型和数据集上,推理开启后 pass@1 均显著提升。

机制一:计算缓冲效应

第一个机制直指生成机制本身:额外生成的 token 充当额外的"计算时间",通过更多前向传播来精炼内部状态。验证方法很巧妙——把推理轨迹替换为无意义的重复字符串"Let me think",匹配原始 token 长度,再让模型预测答案。

dummy thought experiment
Figure 4: 计算缓冲效应。即使推理内容完全无意义(ON Dummy),回忆能力仍显著高于推理关闭(OFF)。

结果是:即使推理内容完全无意义,模型回忆正确答案的能力仍然显著提升。但这个效应有上限——dummy 文本继续加长后收益递减,且始终无法匹配自然推理的效果。说明额外计算有帮助,但思考的"内容"也很重要。

scaling omega
Figure 5: dummy 文本长度与推理有效性的关系。超过原始推理轨迹长度后,收益递减。

机制二:事实启动效应

分析自然推理轨迹后发现:模型并不是在做逻辑推理,而是在"调取相关事实"。这就是心理学中扩散激活(spreading activation)的类比——处理一个概念会激活语义记忆中相关的概念。论文称之为"factual priming"。

验证方法:从推理轨迹中提取被提及的具体事实,过滤掉填充文本和目标答案的直接提及,然后仅在推理关闭模式下输入这个短小的事实列表。结果显示,仅凭事实列表就能恢复推理带来的大部分增益。

factual priming
Figure 6: 事实启动效应。仅用推理中提取的事实列表(OFF Facts),就恢复了大部分推理增益。
经典案例:问"尼泊尔第10位国王是谁",推理模型会先列出前九位国王。这些中间事实就是"垫脚石"——语义热身让第10位的回忆变得可行。

幻觉陷阱

Factual priming 有效,但脆弱。模型自己生成中间事实,可能产生幻觉。大规模审计揭示:推理轨迹中包含哪怕一个幻觉事实,最终答案正确率显著下降。

hallucination effect
Figure 7: 幻觉对最终答案的影响。每个点是同一道题在干净轨迹(x轴)vs 含幻觉轨迹(y轴)的正确率。大多数点在红线之上——幻觉降低了正确率。

工程启示

两个机制的发现直接指向了改进方向:

测试时选择:对同一问题生成多条推理轨迹,只保留中间事实可验证且无幻觉的轨迹,准确率显著提升。这可以用 process reward 在训练时鼓励基于事实支持的中间步骤。

推理不是万能的:对于 LLM 确实不知道的事实,再怎么推理也回忆不出来——pass@k 曲线在足够大的 k 时会趋于平缓。推理只是扩大了可召回知识的边界,而非凭空创造知识。

本质洞察

这篇论文的核心价值在于揭示了推理在 LLM 中扮演的、远超"任务分解"的基础角色。计算缓冲效应解释了"为什么无意义的思考也有用",事实启动效应解释了"为什么有意义的思考更好"。它们互补而非互斥——推理不仅是解决复杂问题的工具,更是暴露模型内部记忆、扩展参数化知识边界的根本机制。