错误的 AI 建议会影响答案,也会改变人判断自己是否知道答案的门槛。一项包含五个实验的预印本发现,当受试者接触到系统性错误的 AI 建议时,说我不知道的意愿明显下降,准确率降低,信心反而上升。研究设计很窄,结论仍有明确价值:可靠的人机协作需要把独立判断和外部核验做成工作流。
这项研究实际测了什么
预印本题为 AI advice suppresses people's willingness to say I don't know,包含 3,132 名受试者和五项实验,其中四项预注册,一项直接复现。
受试者回答六道电影画面细节题,始终可以选择放弃回答。不同组别分别看不到 AI、可以主动请求 AI 建议,或者自动看到 AI 建议。部分实验加入小额激励:答对奖励 0.10 美元,答错扣除 0.10 美元,放弃回答不增不减。
研究者专门挑选了 Step 3.5 Flash 容易答错的问题。这样可以观察一个流畅但不可靠的答案如何改变人的行为。它测量的是错误建议场景,无法代表现代 AI 在日常任务中的平均效果。
预注册的核心指标是 judgment suspension,可以理解为在不确定时暂停判断,选择不回答。
三组数字来自不同实验口径
媒体报道把结果压缩成一条很有传播力的链条:说我不知道的比例从 44% 降到 3%,准确率从约 27% 降到 9%,信心从约 30 升到 76。这些数字都能在论文里找到,但来自不同实验或分析集。
准确口径如下:
- Study 1b 中,无 AI 组的判断悬置比例是 44%,可请求 AI 组是 3%。
- 作者合并无激励条件后,正确率为无 AI 组 27.5%,AI 组 9.2%。
- Study 2 的无激励条件中,平均信心为无 AI 组 29.6,AI 组 75.9。
整体模式仍然清楚:接触 AI 建议后,受试者回答了更多问题,答对得更少,主观上却更确定。把不同分母说清楚,可以避免把媒体拼接的叙事误写成一项连续实验。
研究对象是人的作答门槛
这项研究经常与模型过度自信放在一起讨论。它研究的是另一层问题:当一个可用的 AI 答案出现时,人会不会更容易决定自己应该回答。
没有 AI 时,不确定感可能触发暂停。一个人可以留空,或者明确说我不知道。流畅建议填补了这个空白,也降低了提交答案的摩擦。即使建议错误,它仍可能让人停止犹豫。
作者提出了多种可能机制,包括信任、语言流畅性、作答成本下降和元认知监控变化。实验尚未区分哪种机制占主导,也没有证明长期批判性思维能力发生退化。它测量的是短期作答、信心和放弃回答的行为。
对产品设计来说,模型信心校准有帮助,但 80% confident 仍然不是独立证据。信心适合决定核验强度,不能承担正确性证明。
小额代价改善了结果,但没有恢复基线
Study 3 在每道题前重复展示激励规则。在 AI 条件下,判断悬置比例从 2% 升到 8%,正确率从 11% 升到 16%。六道题中,请求 AI 的平均次数也从 5.27 降到 4.53。
错误成本可见后,行为确实发生了变化,但仍没有恢复到无 AI 条件的水平。
这个结果给出一个产品启示:错误代价需要在决策时刻可见。只追求无缝和快速完成的界面,会让提交答案变得过于便宜。适量、结构化的摩擦,可以促使用户重新检查建议。
论文没有直接测试警告标签、强制引用、延迟展示 AI 建议或正式核验流程。下面的设计框架属于基于证据的工程推论。
证据的五条边界
第一,所有问题都是电影中的细小视觉细节,任务既困难又缺少现实风险。
第二,研究者选择这个模型,正是因为它在这些题上几乎总是答错。AI 通常正确时,判断悬置是否仍会以相同幅度下降,目前没有答案。
第三,每题 0.10 美元的激励无法代表医疗、法律、投资或职业声誉责任。
第四,研究没有记录受试者是否查询网页、咨询其他模型或使用其他来源。激励后的准确率改善,可能来自减少 AI 依赖,也可能来自增加外部核验。
第五,这仍是一篇预印本。预注册和直接复现提高了可信度,同行评审尚未完成。
因此,合适的结论是:面对自己不知道的问题时,如果人接触到流畅且系统性不可靠的 AI 建议,暂停判断的意愿可能大幅下降。它无法证明一般 AI 使用会让人的准确率下降三倍。
相关研究补上了现实工作场景
Microsoft Research 在 CHI 2025 发表的一项研究,调查了 319 名知识工作者使用生成式 AI 时的批判性思维。对 AI 能力越有信心,受访者报告的批判性思维越少;对自己完成任务和评估结果的能力越有信心,报告的批判性思维越多。受访者把信息核验、结果整合和任务把关视为仍需投入认知的部分。
这项 Microsoft 研究依赖自报数据,无法证明因果关系,但它为受控电影题实验提供了现实工作场景的补充。
另一类研究专门改善模型的信心校准。RLCR 论文通过训练让模型给出更贴近真实正确率的信心。更好的校准能让不确定性更可见,但不会自动消除用户对流畅答案的依赖,也无法替代来源和外部检查。
这些研究指向三个独立目标:
- 模型校准:模型能否暴露不确定性。
- 人的校准:用户能否保留暂停和拒答的能力。
- 系统验证:工作流能否检测主张是否成立。
可靠产品需要同时处理这三层。
三段式验证闭环
下面的闭环是从研究结果推导出的设计方案,尚未由这篇预印本直接验证。
第一段:先形成独立判断
展示 AI 建议前,先记录用户的初始答案、理由、信心,以及明确的我不知道选项。随后冻结这份快照。
它为后续比较建立基线,也避免 AI 答案无痕覆盖人的第一判断。低风险任务只需一句理由或一个信心选项;高风险决策则应要求证据。
第二段:比较差异,而非覆盖答案
展示 AI 的答案、假设、来源和不确定性,并生成它与初始判断之间的冲突 diff。
用户需要把差异标记为接受、拒绝或待核验。界面保留两个版本,让交互从被动采纳变成显式裁决。
第三段:通过独立通道核验
高风险主张必须经过与生成模型独立的通道检查。具体方式包括:
- 一级信源或权威数据库。
- 确定性计算。
- 单元测试、仿真或可复现查询。
- 拥有独立上下文的第二位专家。
- 使用不同证据、彼此隔离的第二模型。
最终决策应保存核验工件,例如 URL、查询结果、测试输出、签名审批或计算表。出现错误时,团队可以追溯判断如何形成。
四个值得测试的产品控制点
对容易被锚定的任务,延迟展示 AI 建议。把我不知道定义为一种成功输出。信心只用于分配核验强度。最后按风险分级:低风险任务允许快速采纳,医疗、法律、财务、安全和生产变更强制要求独立证据或第二人闸门。
这与可信 AI 系统的一条基本原则一致:信任来自可验证性。流畅回答可以提升效率,系统通过让错误可被发现来获得信任。
FAQ
AI 建议总会降低人的准确率吗
不会。这项研究专门使用模型通常答错的问题,只能说明不可靠建议如何影响行为,不能衡量 AI 辅助的平均价值。
为什么询问 AI 有多大把握还不够
自报信心仍然是模型输出。它可以帮助路由低信心案例,但高信心不能独立证明主张正确。
金钱奖励能阻止受试者盲从 AI 吗
小额激励减少了 AI 使用并提高准确率,但判断悬置仍远低于无 AI 条件。
让模型学会说我不知道能否解决自动化偏差
它能改善一个重要信号。用户仍可能过度相信高信心答案,模型本身也可能校准错误,因此仍需独立证据和工作流控制。
哪些 AI 输出必须独立核验
错误会影响金钱、权利、健康、安全、生产系统或公开主张时,应执行独立核验。精确数字、近期事件和违背领域经验的结论也需要核验。
参考资料
- Chiara Marcoccia、Walter Quattrociocchi、Valerio Capraro:AI advice suppresses people's willingness to say I don't know,2026 年预印本。
- Hao-Ping Lee 等:The Impact of Generative AI on Critical Thinking,CHI 2025。
- Zhenlin Xu 等:Reinforcement Learning for Confidence Calibration,2025。
- Parasuraman、Manzey:Complacency and Bias in Human Use of Automation,2010。