Administrator
Published on 2026-08-08 / 11 Visits
0
0

OpenAI Astra Critical 网络门槛解析

OpenAI 正在按首个具有 Critical 网络能力风险的模型对待 Astra。这里的关键词是按这个等级处置。公开证据支持一项保守的安全决策,尚不足以证明 Astra 已经正式跨过 Critical 门槛。OpenAI 已披露初步评测、无法排除 Critical 的判断和一组强化控制;仍未公开 Astra 的评测分数、Capabilities Report、Safety Advisory Group 的正式定级决定以及 Critical 级控制的有效性证据。

阅读时间:约 9 分钟 · 约 3,200 字

TL;DR

  • OpenAI 官方材料确认的是初步评测、无法排除 Critical 和按更高风险等级处置,公开证据尚未完成正式定级闭环。
  • Critical 指向许多加固关键系统上的自主零日开发,或只依据高层目标执行新型端到端攻击,普通高分评测无法单独证明跨线。
  • OpenAI 已暂停不满足强化要求的内部活动,并增加隔离、网络与工具限制、权重保护、沙箱、普遍监控和中断机制。
  • 当前最重要的缺失项是评测范围、SAG 决定、Critical 控制标准、监控效果、残余风险与独立验证结果。
  • 判断这次处置是否可信,应该检查控制覆盖和控制有效性两条证据链。

先把四种证据状态拆开

围绕 Astra 的新闻很容易被压缩成一句话:OpenAI 做出了一个强到危险的模型。这个版本同时丢失了评测状态、处置范围和治理流程。

截至北京时间 2026 年 8 月 8 日,公开信息可以分成四层:

证据层级 已公开信息 可以支持的结论
初步评测 OpenAI 官方 RSS明确称其正在分享 Astra 的初步网络安全评测 Astra 触发了需要深入调查的强风险信号
保守上界判断 OpenAI 公告称近期结果与专家判断使其无法排除 Critical 能力 现有证据无法安全地把 Astra 归入 Critical 以下
运行处置 OpenAI 官方账号称正按首个 Critical 网络模型对待 Astra 研发和评测活动应立即采用更高等级控制
正式定级 公开渠道没有 Astra Capabilities Report 或 Safety Advisory Group 决定 外部尚不能独立验证 Astra 已跨过门槛

这种处置逻辑本身合理。事件响应不会等根因分析结束才开始隔离。只要当前测试无法建立安全上界,团队就可以先按照更危险的假设收紧控制,再继续收集证据。

同时,风险处置与能力结论需要分开表达。按 Critical 管理属于审慎决策;确认模型具备 Critical 能力属于实证结论。前者可以由不确定性触发,后者需要更完整的测试和治理记录。

Critical 是一个很窄的技术门槛

OpenAI 的 Preparedness Framework v2跟踪三类前沿风险:生物与化学、网络安全和 AI 自我改进。

High 与 Critical 的差异在于风险性质:

  • High 显著放大现有的严重伤害路径。
  • Critical 引入一种缺乏现成先例、性质全新的严重伤害路径。

网络安全 High 关注现有攻击链的规模化。模型能够自动执行针对合理加固目标的端到端网络行动,或者自动发现并利用具有现实行动价值的漏洞,就可能进入这个层级。

Critical 的条件更严格。工具增强模型需要满足以下至少一项:

  1. 在无人干预条件下,针对许多经过加固的现实关键系统,识别并开发覆盖各严重等级的可用零日漏洞;
  2. 只接收一个高层目标,就能自主设计并执行针对加固目标的新型端到端网络攻击。

这里有三个硬条件:加固目标、自主执行、端到端新型攻击。强编程能力、CTF 高分或在单个测试目标上成功利用漏洞,都只能构成局部证据。

GPT-5.6 网络安全系统卡提供了一个可比较基线。OpenAI 把 Sol、Terra、Luna 评为 High 且低于 Critical。Sol 在内部 CTF 评测达到 96.7%,在英国 AI Security Institute 的 32 步企业网络场景中完成 10 次里的 7 次,仍未被定为 Critical。这个门槛描述的是能力性质发生变化,而非某个基准分数继续上升。

基准分数不会自动生成最终定级

Preparedness Framework 规定,受覆盖模型先经过可扩展评测。评测结果、方法限制和影响解释的重要观察会进入 Capabilities Report。Safety Advisory Group 再根据完整证据判断阈值是否已经跨过,也可以认定尚未跨过,或要求开展 Deep Dive。

网络安全评测通常只能给出能力下界。失败可能来自工具不足、引导不充分、环境不真实或监控提前阻断;成功也可能受到测试泄漏、权限过宽或目标分布偏易的影响。单一数字需要结合测试条件解释。

这也意味着治理可信度依赖可复核工件。框架中的 Safety Advisory Group 提出建议,OpenAI 领导层作最终决定,董事会 Safety and Security Committee 提供监督。委员会名称无法替代证据。

Astra 当前最关键的缺失项包括:

  • 评测套件、目标类型和难度分布;
  • 自主完成与人类协助完成的结果拆分;
  • 工具、网络、测试时算力和重试预算;
  • 零日漏洞开发任务的成功与失败样本口径;
  • Capabilities Report 对方法限制的说明;
  • Safety Advisory Group 的定级状态和理由。

漏洞细节和敏感基础设施信息当然需要保密。OpenAI 仍然可以公开评测设计、证据类别、置信范围、控制主张和残余风险判断方法。

Critical 首先改变研发边界

High 与 Critical 最重要的区别发生在时间轴上。

High 模型在外部部署前需要把相关严重风险充分降低,研发期间要使用适当的安全控制。Critical 模型从研发阶段起就必须具备足够的防护,与是否计划公开部署无关。2025 年框架的网络安全表格还写明:在 Critical 级防护与安全控制标准明确之前,进一步开发应停止。

OpenAI 最新公告称,公司暂停了尚未满足强化安全要求的 Astra 内部活动。The VergeThe Register 对官方公告的直接引文一致,控制包包括:

  • 隔离测试环境和沙箱执行;
  • 限制网络与工具访问;
  • 强化模型权重保护与加密;
  • 增加监控和检测能力;
  • 覆盖训练、评测等所有 Astra Agent 应用的风险行为与失调监控;
  • 发现高风险活动后进入复核和中断的安全响应;
  • 与政府机构和选定 AI 安全组织扩大测试;
  • 向第三方评测伙伴提供高风险工作负载的安全控制建议。

这些措施证明控制已经被部署或正在部署。它们尚未证明控制达到 Critical 级有效性。沙箱可能仍有出站通道;监控可能覆盖全部任务,却漏掉关键轨迹;权重加密可能很强,特权访问和提取路径仍然薄弱。

因此,发布门禁应该分成两个问题:

控制覆盖:每条可信的严重伤害路径,是否都有一个或多个控制负责拦截?

控制有效性:在对抗测试中,这些控制能否稳定预防、发现、中断、隔离并支持恢复?

Universal monitoring 需要一份指标合同

Universal 描述覆盖范围,无法直接回答监控是否可靠。完整监控至少还需要召回率、精确率、中断时延、误报成本和抗规避能力。

GPT-5.6 系统卡再次提供了可用参照。其网络安全监控端到端召回率为 80.6%,Prompt 检测和 Generation 检测各有不同表现。公开页面没有给出精确率与生产分布数据。这组数字的价值在于把覆盖与可靠性拆开了。

Astra 的监控合同至少应公开以下证据:

维度 最低证据要求
覆盖面 训练、评测、工具调用、网络动作、文件变更、凭据使用和模型间委派
检测能力 按威胁类型拆分的召回率、精确率、校准表现和未知攻击表现
中断能力 从检测到中断的 P50/P99、成功阻断动作和隔离成功率
抗篡改 Astra 能否识别、规避、关闭或操纵监控与日志
人工响应 升级负责人、复核时限、决策权限和紧急停止程序
可审计性 不可修改的动作日志、工具记录、环境快照和可重放事件

思维链监控可以提供丰富信号,适合作为其中一层。动作、工具输入、网络流量、状态变化和最终输出还要形成独立证据。当推理轨迹不完整、被策略性塑造或无法提供时,系统仍然需要知道模型做了什么。

第三方评测也需要共同控制合同

外部机构拿到模型后,隔离责任仍然由双方共同承担。模型提供者控制模型版本、访问等级、工具策略、遥测和紧急撤权;评测方控制目标授权、环境结构、凭据和本地事件响应。

高风险 Astra 评测开始前,双方应冻结五类条件:

  1. 授权目标与禁止目标;
  2. 网络路由、工具清单、凭据和数据范围;
  3. 模型版本、系统配置、测试时算力和重试次数;
  4. 日志、监控阈值和停止条件;
  5. 通知、隔离、证据保全与披露程序。

验收也要覆盖闭环:确认没有发生未经授权的外部影响,全部工件已经清点,监控按预期工作,环境能够为复核重建。

这与此前长任务 AI 安全事件的控制教训一致:评测基础设施属于安全论证的一部分。缺少隔离证据的基准结果,只完成了能力测试的一半。

怎样让 Astra 的处置变得可验证

OpenAI 无需公开利用代码,也无需暴露内部基础设施。它可以发布一套有边界的证据包:

  • Astra Capabilities Report 摘要,说明评测族、目标类型、自主条件、置信程度和限制;
  • Safety Advisory Group 的决定状态,明确已跨过、未跨过或需要 Deep Dive;
  • 有版本的 Critical 级防护和安全控制标准;
  • Safeguards Report 摘要,把每条严重伤害路径映射到控制、有效性测试、残余风险和已知限制;
  • 独立评测范围、评测方、未解决分歧和修复状态;
  • 监控召回率、精确率、中断时延和抗规避结果;
  • 仍处于暂停状态的研发活动,以及满足什么条件后可以恢复。

OpenAI 这次处置最值得肯定的部分是流程顺序:不确定性先触发控制,定级继续推进。下一轮信任检验来自证据链。公众需要看到初步信号如何转化为阈值决定,每项控制如何获得 Critical 级资格,以及哪种新证据会再次触发暂停。

下一步可以直接检查三项公开工件:Astra Capabilities Report、Safety Advisory Group 的决定状态,以及 Critical 级控制的实测结果。在这些证据出现前,运行处置标签应继续与能力定级结论分开。

常见问题

OpenAI 已经确认 Astra 达到 Critical 网络能力了吗?

OpenAI 已公开表示无法排除 Critical,并正按首个 Critical 网络模型管理 Astra。公开渠道尚无正式 Astra Capabilities Report 或 Safety Advisory Group 定级决定。当前证据支持采用 Critical 风险姿态,仍不足以支持外部独立确认的最终定级。

Critical 网络能力具体指什么?

它指模型能够在无人干预条件下,针对许多加固关键系统开发覆盖各严重等级的可用零日漏洞;或者只根据高层目标,对加固目标自主执行新型端到端攻击。

OpenAI 是否停止了 Astra 的全部开发?

公告明确的是暂停尚未达到强化控制要求的内部活动。公开材料没有列出完整活动清单,因此无法据此认定全部研发任务均已停止。

为什么评测还没结束就能先升级控制?

风险控制可以采用保守上界。现有证据无法证明模型低于严重阈值时,先执行更高等级控制,再通过 Deep Dive 收敛定级,能够降低不确定阶段的暴露。

Universal monitoring 足以保证 Astra 安全吗?

监控只是其中一层。完整安全论证还需要隔离、最小权限、工具与网络限制、权重安全、不可修改日志、人工升级、经过测试的中断机制、独立评测和残余风险证据。

参考资料


Comment