Administrator
Published on 2026-09-20 / 34 Visits
0
0

AI Kill Switch 治理:权限、证据与恢复协议

AI Kill Switch 最容易被画成一个红色按钮,真正困难的是按钮周围的控制系统:谁有权按下、什么证据足以触发、具体停止哪些能力,以及满足什么条件才能恢复。加州 N-9-26 行政令把这个问题放进了政策时间表,也把持续独立验证写进了设计目标。

本文给出权限、证据与恢复三份协议,并把每一步转换为可以演练和验收的控制项。

证据核验日期:2026 年 9 月 20 日。本文明确区分当前有效要求与作者提出的工程协议。

阅读时间:约 10 分钟 · 全文约 5700 字

核心结论

  • 加州行政令要求在 2026 年 11 月 16 日前提交前沿模型 Kill Switch 的技术可行性与潜在效果建议。当前动作是形成建议,并未直接建立一个通用开关。
  • 真正可用的 Kill Switch 是一组分级控制动作,包括限制推理、停止新任务、撤销凭据、隔离网络、冻结工作负载和暂停服务。
  • 这套控制需要三份协议:权限协议确定谁能停,证据协议确定凭什么停,恢复协议确定怎样重新上线。
  • 核心指标是实际权限何时被撤销,以及触发到生效之间还可能发生多少不可逆后果,而非控制台是否显示命令已发送。
  • 独立验证需要同时测试关闭与恢复。带着旧凭据、旧队列或未修复根因恢复运行,等于把同一次事故重新启动。

行政令究竟做了什么

加州州长于 9 月 18 日签署 N-9-26 行政令。行政令要求 Government Operations Agency 会同州长紧急服务办公室,在 11 月 16 日前向州长办公室提交建议,研究现有州法可能增加的 AI 安全与安保措施。

其中一项是研究是否要求前沿模型建立 Kill Switch,并由独立验证机构持续核验其有效性。其他研究事项还包括:让独立验证机构进驻前沿 AI 实验室,对安全框架、透明度报告和风险评估进行独立验证,以及把失控事件纳入关键安全事件定义。

这里的措辞决定了文章边界。行政令启动的是技术与立法设计过程,尚未规定统一技术方案、触发门槛和权限链。它提出了一个更具体的工程问题:一套能够接受独立验证的 Kill Switch,究竟要证明什么?

这个方向与 NIST AI 风险管理框架一致。NIST 要求组织明确停用偏离预期用途的 AI 系统所需机制和责任,并把事件响应、恢复、沟通与变更管理放在同一个生命周期内。NIST 提供的是自愿采用的通用框架,企业仍需把它转换为可以执行和验收的具体协议。

一个名称背后有五级动作

Kill Switch 这个词压缩了太多不同对象。模型权重、API 服务、Coding Agent 和嵌入工业设备的 AI,拥有完全不同的控制面。对其中一些对象执行全局关闭,技术上不可行;对另一些对象执行全局关闭,附带损失可能高于局部隔离。

生产系统可以先建立五级控制梯度:

级别 控制动作 常见范围
L0 观察并保全证据 单次运行、身份、模型版本或租户
L1 限流或关闭单项能力 工具、接口、推理速率或动作类型
L2 撤销权限并隔离路径 凭据、网络外联、连接器或子 Agent
L3 暂停工作负载或部署 集群、产品入口、区域或模型版本
L4 全面停机并进行外部隔离 受影响服务、开发环境及关联基础设施

这样,问题就从有没有开关转为:组织能否在规定时间内,撤销正确范围内的权限。全面停机只是响应系统的最高级动作。

Agent 系统尤其需要这个区分。模型进程停止后,已经委派的凭据、排队任务、子 Worker、Webhook 和已复制工件仍可能继续产生效果。有效停机边界应覆盖全部可触达权限,而非只覆盖模型进程。

第一份协议:事故发生前先把权限写清楚

如果团队在事故发生后才讨论谁能下令,紧急控制会退化为会议。权限协议至少应预先定义五类角色:

  1. 信号责任人:接收告警并完成初步定级。
  2. 事件指挥者:选择响应等级并承担协调责任。
  3. 控制执行者:在模型、身份、网络和工作负载控制面执行动作。
  4. 独立验证者:确认目标权限已经真正撤销,并核对证据链是否保存。
  5. 恢复批准者:在整改和回归测试完成后,批准分阶段恢复。

小团队可以由同一人承担多个角色,记录中仍需区分每一项决定。影响范围越大,职责分离越严格。

每次激活都应生成一份持久化权限对象:

事件 ID + 激活角色 + 委托范围 + 目标资源
+ 策略版本 + 动作级别 + 生效时间 + 到期时间
+ 触发原因 + 所需证据 + 恢复批准者

紧急权限应自动到期。事故结束后仍然有效的广域停机权,本身就是一项长期高权限。自动监测器或子 Agent 接受的委托只能落在父级权限范围内,撤销父级委托时,其全部下游授权也应失效。

NIST AI RMF 同时强调两件事:高层管理者承担 AI 风险决策责任,操作层的职责和沟通链必须清晰。两者组合后,管理层负责风险决策,一线响应者获得边界明确、可以快速执行的临时权限。

政府法定权限是另一层控制

2026 年 7 月 23 日提出的联邦 AI Kill Switch Act,即 H.R. 9917,提供了一个具体对照。该提案授权国土安全部长通过 CISA 局长执行,并会同商务部长和国家情报总监,在认定已经发生法案所定义的事件后,下令采取与事件性质和紧迫性相称的措施。它目前仍是法案提案,尚未成为现行法律。

法案文本把政府下令权与企业执行责任分开。受覆盖企业需要保存模型权重和遥测,在可行范围内通知受影响运营者或用户,向主管部门确认命令已经执行,并接受审计、遥测核验、现场检查或其他取证复核。企业可在命令后 48 小时内申请复议,但复议不会暂停命令;也可在 60 天内申请司法审查。

这套结构补充了企业内部手册经常缺失的三项治理元素:外部下令主体、执行结果的独立核验和申诉路径。部署方仍需自行承担依赖关系、业务连续性、用户影响和安全恢复责任。

第二份协议:每一级动作绑定对应证据

证据强度与动作强度需要同步升级。一次异常输出足以触发证据保全和临时限流,全面停机通常需要更强依据;当延迟本身会制造不可接受的风险时,则按预先批准的紧急门槛升级。

一套可执行的证据阶梯如下:

证据等级 已确认事实 默认允许动作
E1 线索 监测器、用户或外部主体报告潜在问题 保留日志、暂停删除、加强监测
E2 关联异常 独立遥测确认异常行为或异常权限使用 限流、关闭单项能力、撤销单一身份
E3 门槛突破 预先声明的风险或策略门槛已经满足 隔离工作负载、停止新任务、暂停版本
E4 已验证失控或影响 复现、独立复核或权威系统状态确认事件 在批准范围内实施广域暂停或全面停机

这四级属于本文提出的工程方案,并非加州行政令的法定分类。它的作用是迫使组织在事故之前公布证据到动作的映射。

每份证据记录至少包含:精确的触发主张、原始事件 ID、模型与策略版本、受影响身份和资源、决策规则、请求动作及执行后观察结果。OECD 发布的 AI 事件通用报告框架给出了 29 项跨司法辖区描述标准,可以作为事件底稿。Kill Switch 还需增加权限范围、动作级别和执行结果等字段。

证据采集必须与阻断控制独立。关闭拦截,也必须保留日志分析过一种危险设计:同一个开关同时关闭执行与证据面,最终留下一个无法解释的安静仪表盘。停机动作应继续保存追加式日志、统一时间戳、系统快照和外部审计记录。

第三份协议:把恢复当作一次新的高风险发布

停机只完成事件响应的一半。恢复会重新授予权限、连接依赖并把系统交还用户,因而需要独立审批链。NIST 把响应与恢复放在同一个管理函数中,正是因为两者共同决定最终风险是否关闭。

最小恢复序列包含八步:

  1. 证明已经隔离:把在线身份、凭据、Worker、队列、网络路径和外部集成与目标停机状态逐项对账。
  2. 保全并重建:冻结原始证据,建立每个结论都能回链源事件的时间线。
  3. 移除根因:修复漏洞、配置、模型行为、流程缺口或授权错误。
  4. 回放事故:把事故轨迹转成回归测试,确认控制在预期边界触发。
  5. 测试相邻正常场景:测量新控制对关键安全业务的误伤。
  6. 灰度恢复:使用全新短期凭据,在更窄范围和更强监测下恢复。
  7. 独立核验:由指定验证方确认线上实际状态,而非只审核整改计划。
  8. 扩容或回退:验收证据持续有效时逐步扩大范围,任何门槛失败都返回隔离状态。

Hugging Face 长任务安全事件分析已经说明,模型层停止指令只能覆盖一层。有效隔离还需处理凭据、外联、工作负载和取证状态,恢复时也必须逐层重新连接。

独立验证应该测什么

年度文档审计无法证明紧急控制此刻仍然有效。持续验证需要定期演练和可观察的服务目标。

指标 回答的问题
有效隔离时间 从触发到禁止行为真正停止用了多久?
范围精度 是否只撤销了策略要求撤销的权限?
触发后的最大不可逆后果 检测到生效之间仍可能产生多大损害?
撤权后成功动作数 权限显示撤销后,是否仍有动作执行成功?
证据存活率 所需日志、快照和决策记录是否完整保留?
孤儿权限数量 还有多少凭据、任务、Worker 或委托处于活动状态?
恢复回归通过率 原始失败是否会触发预期控制?
灰度回退时间 恢复验收失败后能否快速返回安全状态?
独立回放成功率 独立主体能否复现关闭与恢复结果?

演练需要覆盖失败路径:主要批准人失联、身份撤销延迟、某个区域断开、遗留 Worker 继续运行、遥测缺失,以及证据尚未齐备时发起恢复。普通路径通过,只能证明理想条件下的能力。

把政策问题变成操作问题

加州行政令要求专家研究技术可行性和持续验证。最终建议可以用七个问题验收:

  • 控制对象究竟是模型、服务、Agent 运行、单项能力,还是开发者的完整部署体系?
  • 哪个公共或私营主体有权启动各级响应?
  • 每一级证据门槛是什么,谁可以复核或申诉?
  • 控制动作能否跨供应商和下游系统撤销委托权限?
  • 停机后必须保留哪些证据?
  • 医疗、公共服务、安全系统和下游客户需要怎样的连续性安排?
  • 哪些测试和独立工件足以批准恢复?

红色按钮无法回答这些问题。权限、证据与恢复协议可以把答案变成操作人员、审计机构和监管方都能测试的工程对象。

可以先用这七个问题做一次桌面演练,记录每项权限实际失效的时刻、停机后存活的证据,以及批准恢复的具体门槛。任何缺失的时间戳、责任人或状态变化,都是可以直接修复的控制缺口。

常见问题

目前是否存在通用 AI Kill Switch?

不存在能够关闭所有模型和部署的通用开关。供应商和部署方可以在自己的基础设施中建设分级控制。加州 N-9-26 当前要求研究前沿模型相关机制,尚未创建全球性技术开关。

Agent 系统为什么需要 Kill Switch?

当行为或权限使用超过预设风险门槛时,它负责限制后续影响。Agent 场景中的有效隔离还需撤销凭据、停止排队任务与子任务、限制网络路径并保存证据。

谁应该拥有激活权?

答案取决于范围和紧迫性。组织可以预先授权事件指挥者实施短期、边界明确的控制;范围更大或持续时间更长的动作,由独立复核者与承担问责责任的管理或法律主体确认。

AI 治理控制包括什么?

它包括贯穿 AI 生命周期的身份、权限、监测、审批、证据、事件响应、恢复和问责机制。

什么是 AI 事件响应?

它是一套协调流程,用于发现、定级、隔离、调查、修复、沟通并恢复有害、异常或未经授权的 AI 系统行为。

参考资料


Comment