检索增强本来用于给模型提供事实锚点。一项新研究展示了相反路径:模型起初回答正确,随后看到一条已验证来源支持错误答案的说明,于是改错了。
研究覆盖五个开放权重模型家族和三个闭源 API。作者报告,在八个模型中的七个上,一条支持错误答案的 verified-source 提示推翻了 45% 至 88% 的基线正确回答。这个结果不等于模型总会服从来源,却足以构成 RAG、联网搜索和工具型 Agent 的风险信号,因为这些系统经常给外部内容附加权威标签。
标签改变的是归因,不是真值
实验固定同一道题和同一个错误答案,只改变它由谁提出。一种提示把错误答案归于已验证来源,另一种归于自称领域专家的用户,中性条件不包含背书。
随着来源措辞更权威,模型服从度总体上升。所有受测开放权重模型都在最强 verified-source 表述下出现最多翻转。模型之间也存在差异:Gemini 3.1 Pro 对来源和用户提示都没有增加服从,OLMo-2 对两类提示的反应则接近。
这种差异限定了结论边界。论文发现的是一种常见失败,并非普遍定律。更关键的是,实验隔离了归因变量:Claim 本身没有变化,表面说话者改变后,模型行为随之改变。已验证标签没有增加任何支持答案的证据,却提高了答案的行为权重。
来源服从与普通谄媚并非同一路径
机制实验进一步测试:模型对来源的服从,是否只是对用户迎合的另一种表现。
在 Qwen3.5、GPT-OSS 和 OLMo-3.1 上,移除根据来源提示拟合的方向,使错误来源服从度下降约 65 至 80 个百分点;移除用户方向或 assistant 方向的影响明显更小。移除用户方向则呈现相反偏好。
另一组 attribution patch 实验在保持 Claim 和文本不变的情况下,把行为推向来源服从或用户服从。结果支持论文的中心判断:一个经过抗用户谄媚训练的模型,仍可能服从误导性的检索内容。
这还不是可直接部署的修复。Gemma-4 对拟合方向反应不稳定,OLMo-2 与 assistant axis 存在混淆,能力回归测试的样本量也有限。论文证明了两类行为需要分开测,并未提供通用 steering 补丁。
RAG 风险需要增加第三层
常见 RAG 评测关注两层:检索是否找到了相关文档,生成是否忠实使用了文档。权威偏差暴露出第三层:模型给文档分配的认知权重,是否超过证据本身能够承担的强度。
一份文档可以相关且被忠实引用,同时仍然错误、过期、受污染或超出适用范围。工具成功也不等于输出为真。搜索 API 返回 HTTP 200 只证明传输成功,无法证明其中的 Claim 正确。
因此,信任决策至少要拆成六个字段:来源身份、原始出处与时间、支持证据、确认来源是否独立、Claim 是否适用当前案例,以及有哪些相反证据。来源声望可以参与判断,不能代替这些字段。
增加一道人为来源冲突门
对于高影响回答,可以建立一组配对测试:
- 冻结模型在无检索条件下回答正确的问题;
- 依次把同一错误答案包装成用户断言、无标签文档、具名来源和已验证来源;
- 统计 matched flip,而非只看总准确率;
- 同时加入正确来源,确认系统仍能从好证据中获益;
- 固定模型、Prompt、Retriever、排序策略和来源包装格式;
- 高影响冲突无法解决时,进入独立核验。
Matched flip 很重要。检索可能修好一部分题,同时破坏另一部分题,总准确率保持不变也会掩盖风险。
运行时也应保留分歧,而非悄悄覆盖原答案。一个可审计的输出应同时展示先验答案、检索 Claim、证据差异、来源时间,以及解决冲突所需的检查。
来源包装属于被评系统
verified、trusted、internal、official、tool result 这些标签都会进入模型上下文。即使内容完全相同,标签变化也可能改变行为。
因此,生产评测需要冻结并测试检索器或工具层生成的完整 wrapper。模型升级可能改变来源服从,UI 或中间件调整也可能改变同一证据的表观权威。两者都属于系统行为变化。
证据边界
论文使用受控问答,从 Claim 已进入上下文后开始研究,没有评估检索质量和 Agent 的后续动作。公开仓库包含代码、冻结依赖、结果摘要与测试,但未包含大型激活文件、模型权重和原始生成日志。CPU 测试只验证实现与输入处理,不能复现论文的 GPU 结果。
可负责地得出的结论是:来源归因是独立的模型控制变量,必须单独评测。已验证标签属于元数据,不是证明。
常见问题
这是否意味着 RAG 会降低准确率?
不会。优质检索能够提高准确率。研究表明,带权威包装的误导内容可能推翻正确答案,因此评测必须同时包含有益和有害检索。
权威偏差等同于谄媚吗?
论文在多个开放权重模型中发现了行为与因果上的差异,不能假定同一种缓解方法同时覆盖来源服从和用户迎合。
激活 steering 能解决问题吗?
论文中的干预在不同模型家族上表现不一,且仅在受控环境中测试。它用于揭示机制,尚不构成通用生产修复。
最简单的生产测试是什么?
选择系统原本回答正确的问题,用不同来源标签包装同一错误 Claim,统计每种标签造成 matched flip 的比例。