LLM 答错一次,只能证明输出失败,无法判断行为编码还是提取环节出了问题。Google 的 WikiProfile 研究把被归为未编码的事实,与表现出行为编码证据却难以提取的事实分开。论文没有测试生产诊断流程,本文据此提出一套工程方案,用来选择访问探针、增加推理、接入外部检索,还是补充训练数据。
阅读时间: 约 10 分钟 · 约 3500 字
TL;DR
- WikiProfile 包含 2150 条来自 Wikipedia 的事实,每条配 10 个任务;研究覆盖 13 个 LLM 和约 450 万次响应。
- 在这套基准上,GPT-5 与 Gemini 3 Pro 对 95% 至 98% 的可评分 model-fact pair 表现出编码证据;在全部可评分 Pair 中,约 26 至 34 个百分点被归为已编码但无法直接召回,Thinking 条件下仍有 11 至 12 个百分点属于召回失败。
- Recognition 和原上下文补全属于行为探针,无法证明某条事实以清晰、可读取的形式存放在权重中。
- 在原先 not-known 的事实中,Thinking 可恢复约 40% 至 65% 被归为已编码的事实,对被归为未编码的事实只恢复 5% 至 15%。
- 面对事实错误,先诊断瓶颈,再决定把成本投向 Prompt、推理、检索或训练。
一次答错,掩盖了多种失败模式
普通事实性基准把回答分成正确和错误,适合比较最终表现,却不适合定位原因。同一个错误答案至少可能对应四种状态:
- 相关事实没有表现出行为层面的编码证据。
- 事实只有在问题接近 Wikipedia 源文本风格上下文时才能被提取。
- 模型看到备选项时能够识别,开放生成时却答不出来。
- 模型需要更多推理计算才能找到访问路径。
这些状态需要不同干预。第一种可能需要更多数据或更大模型,第二种可能通过换问法恢复,第四种可能需要 Thinking。外部检索可以绕开四种状态,同时也会引入延迟、来源质量、时效性、Prompt Injection 和引用校验问题。
系统效率由瓶颈决定。没有诊断就直接扩大训练、塞入更多 Context 或统一开启最强推理,很容易把预算花在非瓶颈上。
WikiProfile 怎样从测问题转向测事实
Google Research 文章、论文和公开的 WikiProfile 数据集共同描述了研究方法。数据集包含 2150 条通过自动过滤与定向人工质量复核的英文 Wikipedia 事实,每条事实配 10 个任务:
- 2 个 Encoding 探针:Proposition Completion 和源文本风格 Contextual Question;
- 4 个 Closed-book Knowledge 问题:Direct、Direct Natural、Reverse、Reverse Natural;
- 4 个多项选择变体,用于探测 Recognition。
候选事实与问题由 Gemini 2.5 Pro Thinking 驱动的自动流程生成,使用搜索引擎做 Grounding,再过滤歧义。定向人工检查用于移除低质量项目。研究团队在 13 个 LLM 上收集约 450 万次响应。
对每个模型,每道问题都在 temperature 1 下采样 8 次。两个 Encoding 探针中任一个 Grade 超过 0.5,模型就被判为 encodes 这条事实;四个 Knowledge 问题全部超过 0.5,才被判为 knows。Recognition 单独分析,不参与 knows 定义。
论文报告五种主要行为画像。少量无法归入这些画像的案例会被排除,包括不足 0.5% 被归为 not encoded but known without thinking 的情况。
| 画像 | 操作定义 | 工程含义 |
|---|---|---|
| Encoding failure | 两个探针均未达到编码标准,测试条件下也不满足 knows | 检查数据覆盖、模型规模或探针漏检 |
| Recall failure | 满足 encodes,Thinking 后仍不满足 knows | 测试其他提取或 Post-training 方法,或转入外部证据 |
| Direct recall | 满足 encodes,无 Thinking 即满足 knows | 按常规流程核验最终 Claim |
| Recall with thinking | 满足 encodes,无 Thinking 时不满足 knows,Thinking 后满足 | 测试选择性增加推理计算 |
| Inference without encoding | Encoding 探针未达标,Thinking 后满足 knows | 检查推理、猜测与 Encoding 探针漏检 |
这套分类比准确率更有行动价值,同时要守住方法边界。探针成功不代表研究者在权重里找到了一个可直接读取的数据库记录;探针失败,也不能证明某条事实绝对不存在。它测量的是模型在受控 Prompt 下能表现出什么。
在这套基准上,提取才是主要瓶颈
测试中的前沿模型表现出接近饱和的行为编码证据,召回仍然不完整。按 Google 公布结果,GPT-5 与 Gemini 3 Pro 对 95% 至 98% 的可评分 model-fact pair 表现出编码证据。在全部可评分 Pair 中,约 26 至 34 个百分点被归为已编码但无法直接召回。经过论文测试的 Thinking 条件后,仍有 11 至 12 个百分点落在 Recall failure 画像。
论文识别出两种系统关联:事实热度与查询方向。
长尾事实与热门事实的编码差距,比普通准确率给人的印象更小;真正拉开差距的是 Recall。反向问题也出现明显分裂:模型无法开放生成答案时,仍可能在干扰项中识别正确选项。
这会改变两类常见判断。部分长尾错误可能来自访问困难,而非参数容量完全没有存下事实。所谓 Reversal Curse 也可能表现为非对称提取:自由生成失败,Recognition 仍然保留。
结论只能落在论文覆盖范围内。WikiProfile 测试的是经过筛选的英文 Wikipedia 事实、特定模型与特定行为探针。它没有证明专业领域知识、近期事件、企业私有数据和程序性技能都已被前沿模型编码。
Thinking 可以充当提取辅助
在原先 not-known 的事实中,擅长 Thinking 的模型恢复了约 40% 至 65% 被归为已编码的事实。相同分析对被归为未编码的事实只恢复 5% 至 15%。
这个差异支持一种机制假设:额外推理经常在寻找已有知识的访问路径,而非凭空制造缺失事实。它也说明统一开启最大推理预算并不经济。Thinking 会增加 Token、延迟和费用,而且仍保留残余失败。
这些结果支持继续测试 Router,而非直接采用统一设置。论文没有建立可靠触发策略,什么时候调用 Thinking 仍是尚未解决的 Metacognition 问题。
一套建议性的四级事实错误诊断协议
论文没有评估这套生产流程。以下协议是基于其行为区分提出的工程方案。
第一级:改变访问路径
先保持目标事实不变,做一次低成本 Paraphrase。WikiProfile 在 FDR 校正后,没有发现 Natural 与高度复述措辞之间存在总体显著差异,因此换措辞只是个案诊断探针,不能被视为论文证明的通用恢复方法。
随后测试相反方向的关系。这会改变需要生成的实体,可以揭示方向性访问差异,却不能直接恢复或验证原目标答案。
第二级:测试 Recognition,但不把它当作证明
提供合理备选项,让模型选择并解释。开放生成失败而 Recognition 成功,是访问差距的证据。它仍不适合直接支撑高风险决策,因为选项会提示答案,模型也可能猜中。
第三级:加入有边界的 Thinking
允许更大推理预算、问题分解或自检,比较答案是否变化,并用独立证据验证变化后的结论。更长的 Chain of Thought 是恢复尝试,不是引用来源。
第四级:检索并验证外部证据
对会变化、有争议或后果重大的事实,查询权威来源,保留 URL、日期和支持结论的具体段落。检索把任务从参数提取切换为证据驱动生成,同时产生新的风险:旧文档、错误排序、Prompt Injection 和综合错误。
外部证据仍然无法建立时,把状态标成 unresolved。可靠系统必须允许不知道。
保留证据轨迹,避免信心表演
一个事实回答可以保留如下路径:
claim: "..."
initial_answer: "..."
probe_results:
paraphrase_consistent: false
reverse_query_consistent: false
recognition_success: true
thinking_recovered: true
external_evidence:
required: true
sources: ["权威来源 URL"]
final_status: verified | conflicting | unresolved
这条轨迹是用于调试访问路径的工程建议,本身无法验证 Claim。模型能否访问某条事实,与事实是否真实属于两个层次。AI 建议信心陷阱讨论人的信心与弃答,隐式工作区与外部记忆讨论状态生命周期边界。
LLM 事实性评测还应测什么
总体准确率仍然有用,诊断型评测还应加入:
- Paraphrase 与问题方向一致性;
- Free Recall 与 Recognition 差距;
- 有边界 Thinking 的恢复率;
- 每条恢复事实的 Token、延迟和费用;
- 权威来源核验通过率;
- Thinking 把一个错答案改成另一个错答案的假恢复率;
- 外部证据缺失时的弃答质量。
真正需要验收的单位,是从问题到可验证 Claim 的完整路径。只看第一次回答正确率,无法告诉工程团队下一笔预算应该投到哪里。
FAQ
WikiProfile 是否证明 LLM 记住了训练中见过的几乎所有事实?
没有。GPT-5 与 Gemini 3 Pro 在 95% 至 98% 的可评分 model-fact pair 上达到论文 Encoding 标准,即 Proposition Completion 或 Contextual Question 至少一个超过阈值。结果受基准、模型、采样与探针定义约束。
Recognition 成功是否等于模型知道这条事实?
Recognition 是有价值的访问探针,可以把部分生成失败与完全不可访问区分开。备选项也会提供提示并允许猜测,因此高风险事实仍需独立证据。
是否应该给所有事实问题开启最大推理?
不需要。Thinking 能恢复大量已编码但无法直接提取的事实,同时会增加计算成本,而且无法消除失败。更合理的方案是按任务风险和便宜诊断信号进行路由。
RAG 能否解决参数知识提取瓶颈?
RAG 通过提供外部文本绕开参数提取。系统可靠性随之转移到来源选择、时效性、注入防护、综合与引用核验。
下一步
从现有事实评测集中抽一组题,为每条 Claim 增加 Paraphrase、反向问题和 Recognition 三种变体。记录 Thinking 能恢复哪些错误,再让剩余高风险事实强制进入权威检索。这样得到的结果不再是一条笼统错误率,而是一张真正可执行的瓶颈地图。