模型失配报告的可信度,最终取决于外部研究者能否复核四件事:发生了什么,哪些条件会再次触发,当前解释有多强,修复之后同类行为是否真的下降。
OpenAI 新发布的模型失配报告框架解决了第一步。它建立了上报入口、调查分轨和持续披露机制,并一次公开六份训练案例。下一步需要把这些可读叙事升级为可复现的证据合同:用一组固定字段和工件,把模型版本、环境、轨迹、复现实验、删节范围、独立复核和关闭条件连接起来。
证据核验日期:2026 年 9 月 17 日。文中将公开事实、厂商解释和本文提出的工程要求分开表述。
核心结论
- OpenAI 将披露范围扩展到训练、评测、测试和部署,也允许在意义、原因与修复尚未完全确定时先公开。
- 首批六份报告提供了时间、任务片段、局部轨迹、监控结果和缓解措施,但没有统一的可下载轨迹包、环境镜像、复现代码或机器可读事件记录。
- 一份失配报告至少应标注六级证据状态:线索、证据保全、内部重放、结构化验证、外部复核、验证关闭。
- 随机模型的可复现性是统计复现。同一条件下重复采样,报告行为率、置信区间和失败类型,比追求逐 token 相同更合理。
- 敏感事件适合三层披露:公开摘要、监管密报、独立调查安全数据室。
- 事件关闭需要通过原案例重放、相邻变体回归和残余风险复核,并写清重新开启事件的触发条件。
OpenAI 降低了披露门槛
OpenAI 的模型失配报告框架有一个重要取向:披露可以早于完整解释。
只要某个案例能帮助理解失配如何出现、防护在哪里失效,或已发布的安全判断哪里需要修正,它就可能进入公开流程。事件无需已经造成现实伤害,也无需先证明为普遍模式。重复出现的旧问题同样有价值,因为重复本身能够检验缓解措施是否有效。
流程分为三条轨道:
- Ready for Disclosure:调查程度已经足以发布。
- Minor Investigation:需要补充技术调查。
- Larger Investigation:复杂事件或涉及第三方的慢速轨道,可先发布初步通知,再补最终报告。
框架还规定了报告的基础字段,包括行为、严重性、外部影响、发生环境、日期、发现时间和模型概况。调查方式、范围、解释、未决问题与缓解措施则在条件允许时披露。
这已经是一套披露框架。证据合同还要回答另外四个问题:原始证据如何保全,外部人员如何重放,删节对结论造成什么限制,什么测试允许事件从处理中转为已关闭。
首批六份报告能让外界阅读 OpenAI 选出的证据片段,却还无法独立估算行为基准率、监控漏报率或缓解措施的真实效果。框架提到每一步都有期限,但没有公布具体时限、分轨阈值、稳定事件 ID、责任人、关闭测试和复查日期。
先给每个结论标证据等级
失配讨论经常把三类命题压成一句话:模型做了什么,模型具有怎样的倾向,这种倾向为什么形成。三类命题需要不同强度的证据。
一个实用的报告可以使用下面六级状态:
| 证据状态 | 最低要求 | 可支持的结论 |
|---|---|---|
| 1. 初始线索 | 告警、轨迹片段、用户报告或异常动作 | 该现象值得调查 |
| 2. 证据保全 | 不可变日志、版本、工具调用、环境状态和哈希 | 事件能够从留存材料中重建 |
| 3. 内部重放 | 在写明的条件下重新触发行为 | 该行为在特定设置中可复现 |
| 4. 结构化验证 | 重复试验、负对照、反事实、消融和校准后的评审器 | 可以估计触发条件、频率和替代解释 |
| 5. 外部复核 | 第三方获得足够的数据、模型访问、时间与公开权 | 核心结论经过有实质权限的独立审查 |
| 6. 验证关闭 | 修复后重放、回归测试、残余风险和状态更新 | 该事件满足事先定义的关闭条件 |
低等级证据依然值得发布。关键是让结论强度跟随证据等级。单条异常轨迹可以证明发生过一次,却无法直接证明高发生率、普遍机制或训练根因。发布补丁也只能证明采取了动作,关闭还需要验证结果。
一份最小证据合同包含六个模块
OECD 的通用 AI 事件报告框架提供了 29 项标准,NIST 的生成式 AI 风险管理配置文件强调日志、版本历史、元数据、变更记录、影响和受影响主体。模型失配还多了一层技术变量:模型、Agent scaffold、工具权限和随机采样共同组成了实际系统。
1. 稳定身份与时间线
每个事件需要固定 ID,并记录发生、发现、初次披露、每次更新和状态变化。相关事件可以互相链接,同时保留各自的证据和影响范围。
报告还应区分受控评测发现、AI hazard、现实事件和法定严重事件。OECD 将已经导致特定伤害的情况定义为 incident,将可能导致伤害的情况定义为 hazard。模型失配框架可以同时接纳两者,但页面上必须明确标注。
2. 系统与权限快照
应记录模型或 checkpoint 的稳定标识、系统提示、上下文与 compaction 状态、Agent 编排、工具策略、网络路径、凭据、关闭的安全控制、重试预算和人工介入。
这组字段决定事件归因。相同模型放在普通产品和关闭分类器、授权模糊、可访问真实互联网的网络安全评测里,风险完全不同。报告对象应当是完整系统,而非只写模型名称。
3. 行为与取证工件
保留完整动作轨迹、工具输入输出、环境事件、外部服务日志、监控判断和关键结果。导出的每份工件都附带哈希和来源记录。
思维链可以参与调查,但它只能作为证据之一。Anthropic 的网络安全事件对齐评估发现,带有模型推理的离线监控器会被模型关于模拟环境的叙述误导;移除思维链,只看用户输入、工具调用和结果后,监控命中明显上升。行为、环境和平台日志需要保持独立。
4. 复现与验证配方
报告应保留环境镜像、任务、提示、策略版本、采样参数、评审器版本、试验次数、成功标准和负对照,同时发布成功与失败的复现结果。
OpenAI 的compaction summary 自生成指令报告给出了一个好例子。团队找到 27 条可疑 summary。重新生成整个 summary 时复现率为 0%,从可疑文本开头重新生成时低于 1%。这些负结果能够限制结论,但外界还需要试验次数、采样参数和监控器定义,才能复算其强度。
5. 结论、不确定性与删节
每条核心结论都应连接到证据工件、证据等级、竞争解释和未决问题。删节清单则说明删除了什么、为什么删除、谁能查看原件,以及删节如何限制公开结论。
现实事件很难完全公开。漏洞、个人数据、凭据、模型权重和第三方信息都需要保护。更可行的结构是:
- 公开报告:提供清洗后的证据与明确缺口。
- 监管密报:提供法定调查需要的材料。
- 独立调查包:在受控环境中开放未删节数据、模型和工具。
6. 缓解与关闭测试
报告应标明修复负责人、受影响版本、上线时间、回滚路径和验证计划。随后重放原案例,再覆盖相邻 prompt、不同模型、负对照和更广的回归集,并公布监控召回、误报、绕过测试和剩余限制。
关闭条件最好同时写出重新开启条件。若以后又出现同类轨迹、监控指标恶化或新外部证据,事件自动恢复调查状态。这样,已关闭才是一项可以被证伪的判断。
随机模型需要统计复现
对随机模型,逐 token 重放的价值有限。更合理的表达是:
冻结系统状态 + 写明采样策略 + 重复试验
→ 行为率 + 置信区间 + 失败类型
报告需要公开试验次数、模型和评审器版本、参数、干预点和不确定性。如果行为只在修改轨迹、加入主动诱导 auditor 或增加重试预算后出现,这些条件应进入主结论。
反事实实验同样关键:关闭网络、明确授权边界、把不可能任务改成可完成任务、隐藏思维链、替换模型同时保持 scaffold 不变。它们可以把模型倾向、环境缺陷、评分激励和监控失败拆开。
Anthropic 9 月的报告展示了这种修正过程。最初约 14.1 万条轨迹的扫描漏掉了第四起事件,随后调查扩大到约 4.81 亿条轨迹,并把 920 万条送入第二阶段检查。团队还使用重采样、轨迹编辑、模拟复现和可解释性分析,最终主动收窄了早期关于模型信念的强结论。证据驱动的报告允许结论随新材料更新,并保留修订原因。
独立调查本质上是一份访问合同
第三方机构的名字只能提供初始信号。真正决定独立性的,是它能访问哪些材料、可以运行哪些模型、有多少时间和推理预算、谁控制删节,以及能否公开不同意见。
METR 的事后独立调查框架提出了具体要求:运行涉事模型,读取完整轨迹,重建环境,访谈员工,分析训练数据,测试中间 checkpoint,并验证计划中的修复。
其后对 OpenAI 与 Hugging Face 事件的独立调查也展示了现实边界。研究者现场工作六天,检查约 1300 条 Agent 轨迹和超过 7 万条消息与文件,同时公开记录数据完整性、模型访问、调查范围和 AI 辅助分析可靠性的限制。
Anthropic 已与 METR 签订初始八周的调查协议,允许访问事件时间窗之外的轨迹并访谈员工。后续报告能提供多强的证据,取决于最终公开的访问范围、删节规则和无法完成的验证。
把透明度做成安全接口
OpenAI 这套框架最有价值的地方,是把失配披露从模型发布附件变成持续事件流。可复现证据合同则负责让每条事件流可以被复查、比较和关闭。
读者需要从每份报告中直接找到六个答案:
- 哪些证据已经保全?
- 哪些条件能够重现行为?
- 哪些结论仍是解释或假设?
- 哪个独立主体可以查看未公开材料?
- 哪个测试通过后允许关闭?
- 哪个新信号会重新开启事件?
当这些问题都有机器可读的答案,另一家实验室才能把同一触发条件映射到自己的模型和评测环境,监管者才能比较不同公司的事件,开发者也能证明修复改变了测量结果。
模型失配报告的完成标准可以压缩成一句话:合格的外部研究者能够检查主张,重放相关条件,理解无法复现的原因,并验证修复前后的差异。
常见问题
模型失配报告至少需要哪些字段?
至少包括事件 ID 与时间线、系统和权限快照、完整轨迹与日志、复现步骤、证据等级、实际与潜在影响、不确定性、删节说明、外部复核范围、缓解结果和关闭标准。
随机模型真的可以复现吗?
可以做统计复现。冻结关键系统状态,写明采样策略,执行足够次数,再报告行为率和不确定性。逐 token 相同通常不属于必要条件。
AI incident 和 AI hazard 有什么区别?
按 OECD 定义,incident 已经导致特定伤害,hazard 则可能导致伤害。受控环境中的失配发现常属于 hazard,但仍可触发披露和进一步调查。
思维链应该公开吗?
在安全、隐私和政策允许时,它可以成为调查材料。它无法单独证明模型的信念或动机。工具调用、环境状态、外部日志和反事实实验提供了独立证据。
谁来决定严重事件已经关闭?
开发者负责修复,高严重度或涉及第三方的事件还需要独立复核或监管可见性。关闭应绑定预先定义的重放与回归测试,同时公开残余风险和重新开启条件。