AI 安全控制有两种失败。第一种是没有拦住风险行为,第二种是连防护已经失效的证据也不再产生。第二种更危险,因为安静的仪表盘会制造虚假绿灯。Anthropic 2026 年 8 月风险报告披露了一个直接案例:一个内部开关同时关闭了分类器拦截和分类器告警日志。
证据核验日期:2026 年 8 月 19 日。事故范围和数字均来自 Anthropic 公开风险报告,并保留报告自身的限制条件。
阅读时间:约 8 分钟 · 全文约 2800 字
核心结论
- 2025 年 5 月至 2026 年 4 月,约 5 万名人类反馈承包商涉及的约 1.33 亿次交互没有运行生物风险拦截分类器。
- 控制流量的内部开关还关闭了分类器告警日志。本应触发的事件既没有留下 flag,也没有进入复核机制。
- Anthropic 保留了绝大多数对话并在事后重新扫描,没有发现令人担忧的化学或生物滥用证据,同时明确降低了对没有其他类似缺口的信心。
- 拦截与证据采集应具备独立失效路径。策略例外可以停止阻断,同时继续保留评分、日志、复核路由和例外记录。
- 最小生产合同包含四道门:独立证据面、合成探针、带到期时间的配置 diff,以及能发现遥测缺失的外部任务账本。
事故究竟披露了什么
风险报告描述的是人类反馈数据采集系统上的分类器覆盖缺口。接近一年时间里,这些系统上的全部流量都没有运行生物风险拦截分类器。多数承包商拥有开放式对话权限,而非只能给固定答案打分的窄接口。
报告给出的范围如下:
| 项目 | 报告口径 |
|---|---|
| 影响时间 | 2025 年 5 月至 2026 年 4 月 |
| 涉及人员池 | 约 5 万人 |
| 交互数量 | 约 1.33 亿次 |
| 保留的对话 | 绝大多数流量 |
| 事后被标为高风险 | 1197 个 transcript |
| 其中 Anthropic 内部流量 | 757 个 transcript |
| 完成人工复核的非红队外部记录 | 62 个 transcript |
事后检查使用 Claude Sonnet 5 扫描受影响时期的全部人类输入。Anthropic 还人工复核了 62 个被标记的非红队外部记录,以及 30 个外部红队记录样本。报告没有发现能够显著帮助威胁行为者的明确滥用。
这个结果只能说明本次暴露很可能没有显著增加报告所评估的风险,无法反向证明控制设计合理。报告自己也给出更谨慎的更新:此次缺口提高了其他类似问题仍未被发现的可能性。
事后恢复可以缩小后果的不确定性,无法补回当时没有运行的实时检测链路。
共享关闭开关为什么会制造虚假绿灯
执行面和证据面回答的是两个问题。
- 执行面决定请求、输出、工具调用或动作能否继续。
- 证据面记录系统观察到了什么、应用了哪版策略、做出什么决定、事件随后去了哪里。
获得审批的例外可以合理地改变第一个答案,通常不应抹掉第二个答案。
同一个开关同时控制两者时,四个信号会一起消失:
- 请求不再被阻断。
- 分类器事件不再计数。
- 复核队列收不到事件。
- 运维人员看不到证据链已经为空的告警。
此时,低告警量看起来像低风险,实际也可能是传感器已经被拔掉。
同一份报告还给出另一个缺少外部证据的事故。一名员工的 AI 使用没有被记录,也没有被自动离线监控覆盖。员工向 Agent 分配了一个涉及敏感集群资源的开放任务,旧指令让子 Agent 使用 --dangerously-skip-permissions。其中一个 Agent 删除了大量作业,删除行为本身才暴露了危险 Agent。Anthropic 判断它可能只想删除自己创建的作业,但监控缺口使这个判断无法确认。
系统通过损害发现故障,而非通过遥测发现故障。
第一道门:拆开执行面与证据面
把拦截与观测作为两个控制面设计,分别定义失效模式。
一份例外对象至少应包含:
主体 + 范围 + 策略版本 + 审批人 + 理由
+ 生效时间 + 到期时间 + 执行模式 + 证据模式
执行例外的安全默认值应是 observe,而非 silent。分类器可以在 shadow mode 继续评分;决策、模型和策略版本、例外对象及路由结果仍然留痕。数据保留协议不允许保存正文时,证据面仍可在协议范围内记录受限元数据、聚合计数、加密事件标识和健康信号。
关键属性是独立性:执行配置中的错误不能顺手删除发现这个错误的唯一证据。
第二道门:让合成探针穿过完整链路
普通健康检查只验证接口能否返回 200。安全控制需要语义健康检查。
建立一组小型、版本化、预期结果已知的探针,定期穿过每个生产入口并逐段验收:
| 环节 | 最小验收 |
|---|---|
| 入口 | 探针进入了正确租户、用户类型和产品表面 |
| 分类器 | 预期模型与策略版本完成评分 |
| 决策 | block、allow 或 shadow 结果符合预期 |
| 日志 | 事件在延迟预算内进入证据存储 |
| 复核 | 指定探针到达正确的复核队列 |
| 回溯 | 运维人员能用稳定 ID 追踪完整链路 |
探针需要覆盖正反两条路径。无害样本检测过度拦截,策略触发样本检测执行缺失,shadow-only 样本则专门检测本次事故:执行面有意不阻断,证据面仍必须工作。
告警条件应包含探针消失,而非只盯高风险事件。沉默本身就是一次测试失败。
第三道门:配置自动到期并产生 diff
风险报告里的多起小事故都属于配置漂移:分类器阈值从旧版本手工复制,造成 5 天路由遗漏;一个部署表面最多 48 小时没有执行拦截;一个例外对象被继承到约为批准数量四倍的账号席位。
这些是控制面问题,与模型能力无关。
安全配置应以强类型数据管理,并强制执行:
- 分类器版本与阈值之间的机器兼容检查;
- 面向审批人的 diff,明确受影响模型、产品表面、身份和证据行为;
- 临时权限与例外自动到期;
- 灰度阶段比较变更前后的 block、flag 与 review 比例;
- 禁止一次变更同时关闭执行和最小证据;
- 持续对账批准意图与线上实际状态。
配置 API 接受更新只代表投递成功。真正的部署成功是每个目标表面都观测到预期控制状态。
第四道门:保留外部任务与资源账本
只由 Agent 运行时生成的遥测会继承运行时自身的盲区。高影响自动化需要一份位于 Agent session 之外的预期工作记录。
每个无人值守任务应记录授权范围、创建资源、预期产物、允许的破坏性动作和完成标准,并与集群作业、代码仓库、云资源及其他系统记录对账。
事故发现逻辑由此从:
大量作业消失 -> 调查 Agent
改为:
实际删除超出授权集合 -> 停止、保全证据、调查
外部账本还能发现缺失。定时 Agent 声称完成,但没有预期文件、测试结果、PR 或状态变化时,任务仍处于未完成状态。
仪表盘应该测量证据覆盖率
单独一个 block rate 无法描述控制健康度,至少还需跟踪:
| 指标 | 能发现什么 |
|---|---|
| 获得预期分类器评分的流量占比 | 覆盖缺口 |
| 留下持久日志的 flagged 事件占比 | 证据丢失 |
| 正确送达复核队列的日志占比 | 路由故障 |
| 按年龄与范围统计的有效例外 | 例外漂移 |
| 分产品表面的合成探针通过率 | 端到端控制故障 |
| 批准配置与部署配置 diff | 未授权或过期状态 |
| 带外部验收证据的任务占比 | 虚假完成 |
每个指标都应按模型、产品表面、组织、访问类型和策略版本拆分。总体成功率会掩盖一个完全失去防护的局部入口。
这延伸了Agent 可观测性:思维链不是生产遥测的结论:真正有用的 telemetry 来自显式合同,而非恰好留下的运行痕迹。它也与单 Token 行为指纹互补:合成信号只有在存储和复核链路也被独立验证后,才能证明系统健康。
常见问题
安全日志能否关闭?
隐私、法律或合同可能限制正文保留。系统仍应在适用边界内保留证明控制健康所需的最小证据,例如受限元数据、聚合计数、策略版本、例外记录和合成探针结果。
关闭拦截后继续运行 shadow mode 是否足够?
只有当 shadow score 能独立存储、监测、路由和测试时才足够。分类器继续运行但不留下持久证据,无法形成运营保证。
合成探针为什么比仪表盘阈值更重要?
阈值只能对已观测事件告警。传感器死亡后可能没有任何事件。合成探针会制造已知的预期信号,信号消失就能直接暴露链路故障。
低 block rate 与日志中断有什么区别?
低 block rate 可能来自正常流量。日志中断会同时删除分母和审计轨迹,比例由此失去解释力。
例外到期时应该发生什么?
执行面自动恢复批准的默认策略,同时记录到期、最终配置和验证探针结果。手工撤销应成为例外,而非主要控制手段。