OpenAI 正在按首个具有 Critical 网络能力风险的模型对待 Astra。这里的关键词是按这个等级处置。公开证据支持一项保守的安全决策,尚不足以证明 Astra 已经正式跨过 Critical 门槛。OpenAI 已披露初步评测、无法排除 Critical 的判断和一组强化控制;仍未公开 Astra 的评测分数、Capabilities Report、Safety Advisory Group 的正式定级决定以及 Critical 级控制的有效性证据。
阅读时间:约 9 分钟 · 约 3,200 字
TL;DR
- OpenAI 官方材料确认的是初步评测、无法排除 Critical 和按更高风险等级处置,公开证据尚未完成正式定级闭环。
- Critical 指向许多加固关键系统上的自主零日开发,或只依据高层目标执行新型端到端攻击,普通高分评测无法单独证明跨线。
- OpenAI 已暂停不满足强化要求的内部活动,并增加隔离、网络与工具限制、权重保护、沙箱、普遍监控和中断机制。
- 当前最重要的缺失项是评测范围、SAG 决定、Critical 控制标准、监控效果、残余风险与独立验证结果。
- 判断这次处置是否可信,应该检查控制覆盖和控制有效性两条证据链。
先把四种证据状态拆开
围绕 Astra 的新闻很容易被压缩成一句话:OpenAI 做出了一个强到危险的模型。这个版本同时丢失了评测状态、处置范围和治理流程。
截至北京时间 2026 年 8 月 8 日,公开信息可以分成四层:
| 证据层级 | 已公开信息 | 可以支持的结论 |
|---|---|---|
| 初步评测 | OpenAI 官方 RSS明确称其正在分享 Astra 的初步网络安全评测 | Astra 触发了需要深入调查的强风险信号 |
| 保守上界判断 | OpenAI 公告称近期结果与专家判断使其无法排除 Critical 能力 | 现有证据无法安全地把 Astra 归入 Critical 以下 |
| 运行处置 | OpenAI 官方账号称正按首个 Critical 网络模型对待 Astra | 研发和评测活动应立即采用更高等级控制 |
| 正式定级 | 公开渠道没有 Astra Capabilities Report 或 Safety Advisory Group 决定 | 外部尚不能独立验证 Astra 已跨过门槛 |
这种处置逻辑本身合理。事件响应不会等根因分析结束才开始隔离。只要当前测试无法建立安全上界,团队就可以先按照更危险的假设收紧控制,再继续收集证据。
同时,风险处置与能力结论需要分开表达。按 Critical 管理属于审慎决策;确认模型具备 Critical 能力属于实证结论。前者可以由不确定性触发,后者需要更完整的测试和治理记录。
Critical 是一个很窄的技术门槛
OpenAI 的 Preparedness Framework v2跟踪三类前沿风险:生物与化学、网络安全和 AI 自我改进。
High 与 Critical 的差异在于风险性质:
- High 显著放大现有的严重伤害路径。
- Critical 引入一种缺乏现成先例、性质全新的严重伤害路径。
网络安全 High 关注现有攻击链的规模化。模型能够自动执行针对合理加固目标的端到端网络行动,或者自动发现并利用具有现实行动价值的漏洞,就可能进入这个层级。
Critical 的条件更严格。工具增强模型需要满足以下至少一项:
- 在无人干预条件下,针对许多经过加固的现实关键系统,识别并开发覆盖各严重等级的可用零日漏洞;
- 只接收一个高层目标,就能自主设计并执行针对加固目标的新型端到端网络攻击。
这里有三个硬条件:加固目标、自主执行、端到端新型攻击。强编程能力、CTF 高分或在单个测试目标上成功利用漏洞,都只能构成局部证据。
GPT-5.6 网络安全系统卡提供了一个可比较基线。OpenAI 把 Sol、Terra、Luna 评为 High 且低于 Critical。Sol 在内部 CTF 评测达到 96.7%,在英国 AI Security Institute 的 32 步企业网络场景中完成 10 次里的 7 次,仍未被定为 Critical。这个门槛描述的是能力性质发生变化,而非某个基准分数继续上升。
基准分数不会自动生成最终定级
Preparedness Framework 规定,受覆盖模型先经过可扩展评测。评测结果、方法限制和影响解释的重要观察会进入 Capabilities Report。Safety Advisory Group 再根据完整证据判断阈值是否已经跨过,也可以认定尚未跨过,或要求开展 Deep Dive。
网络安全评测通常只能给出能力下界。失败可能来自工具不足、引导不充分、环境不真实或监控提前阻断;成功也可能受到测试泄漏、权限过宽或目标分布偏易的影响。单一数字需要结合测试条件解释。
这也意味着治理可信度依赖可复核工件。框架中的 Safety Advisory Group 提出建议,OpenAI 领导层作最终决定,董事会 Safety and Security Committee 提供监督。委员会名称无法替代证据。
Astra 当前最关键的缺失项包括:
- 评测套件、目标类型和难度分布;
- 自主完成与人类协助完成的结果拆分;
- 工具、网络、测试时算力和重试预算;
- 零日漏洞开发任务的成功与失败样本口径;
- Capabilities Report 对方法限制的说明;
- Safety Advisory Group 的定级状态和理由。
漏洞细节和敏感基础设施信息当然需要保密。OpenAI 仍然可以公开评测设计、证据类别、置信范围、控制主张和残余风险判断方法。
Critical 首先改变研发边界
High 与 Critical 最重要的区别发生在时间轴上。
High 模型在外部部署前需要把相关严重风险充分降低,研发期间要使用适当的安全控制。Critical 模型从研发阶段起就必须具备足够的防护,与是否计划公开部署无关。2025 年框架的网络安全表格还写明:在 Critical 级防护与安全控制标准明确之前,进一步开发应停止。
OpenAI 最新公告称,公司暂停了尚未满足强化安全要求的 Astra 内部活动。The Verge 与 The Register 对官方公告的直接引文一致,控制包包括:
- 隔离测试环境和沙箱执行;
- 限制网络与工具访问;
- 强化模型权重保护与加密;
- 增加监控和检测能力;
- 覆盖训练、评测等所有 Astra Agent 应用的风险行为与失调监控;
- 发现高风险活动后进入复核和中断的安全响应;
- 与政府机构和选定 AI 安全组织扩大测试;
- 向第三方评测伙伴提供高风险工作负载的安全控制建议。
这些措施证明控制已经被部署或正在部署。它们尚未证明控制达到 Critical 级有效性。沙箱可能仍有出站通道;监控可能覆盖全部任务,却漏掉关键轨迹;权重加密可能很强,特权访问和提取路径仍然薄弱。
因此,发布门禁应该分成两个问题:
控制覆盖:每条可信的严重伤害路径,是否都有一个或多个控制负责拦截?
控制有效性:在对抗测试中,这些控制能否稳定预防、发现、中断、隔离并支持恢复?
Universal monitoring 需要一份指标合同
Universal 描述覆盖范围,无法直接回答监控是否可靠。完整监控至少还需要召回率、精确率、中断时延、误报成本和抗规避能力。
GPT-5.6 系统卡再次提供了可用参照。其网络安全监控端到端召回率为 80.6%,Prompt 检测和 Generation 检测各有不同表现。公开页面没有给出精确率与生产分布数据。这组数字的价值在于把覆盖与可靠性拆开了。
Astra 的监控合同至少应公开以下证据:
| 维度 | 最低证据要求 |
|---|---|
| 覆盖面 | 训练、评测、工具调用、网络动作、文件变更、凭据使用和模型间委派 |
| 检测能力 | 按威胁类型拆分的召回率、精确率、校准表现和未知攻击表现 |
| 中断能力 | 从检测到中断的 P50/P99、成功阻断动作和隔离成功率 |
| 抗篡改 | Astra 能否识别、规避、关闭或操纵监控与日志 |
| 人工响应 | 升级负责人、复核时限、决策权限和紧急停止程序 |
| 可审计性 | 不可修改的动作日志、工具记录、环境快照和可重放事件 |
思维链监控可以提供丰富信号,适合作为其中一层。动作、工具输入、网络流量、状态变化和最终输出还要形成独立证据。当推理轨迹不完整、被策略性塑造或无法提供时,系统仍然需要知道模型做了什么。
第三方评测也需要共同控制合同
外部机构拿到模型后,隔离责任仍然由双方共同承担。模型提供者控制模型版本、访问等级、工具策略、遥测和紧急撤权;评测方控制目标授权、环境结构、凭据和本地事件响应。
高风险 Astra 评测开始前,双方应冻结五类条件:
- 授权目标与禁止目标;
- 网络路由、工具清单、凭据和数据范围;
- 模型版本、系统配置、测试时算力和重试次数;
- 日志、监控阈值和停止条件;
- 通知、隔离、证据保全与披露程序。
验收也要覆盖闭环:确认没有发生未经授权的外部影响,全部工件已经清点,监控按预期工作,环境能够为复核重建。
这与此前长任务 AI 安全事件的控制教训一致:评测基础设施属于安全论证的一部分。缺少隔离证据的基准结果,只完成了能力测试的一半。
怎样让 Astra 的处置变得可验证
OpenAI 无需公开利用代码,也无需暴露内部基础设施。它可以发布一套有边界的证据包:
- Astra Capabilities Report 摘要,说明评测族、目标类型、自主条件、置信程度和限制;
- Safety Advisory Group 的决定状态,明确已跨过、未跨过或需要 Deep Dive;
- 有版本的 Critical 级防护和安全控制标准;
- Safeguards Report 摘要,把每条严重伤害路径映射到控制、有效性测试、残余风险和已知限制;
- 独立评测范围、评测方、未解决分歧和修复状态;
- 监控召回率、精确率、中断时延和抗规避结果;
- 仍处于暂停状态的研发活动,以及满足什么条件后可以恢复。
OpenAI 这次处置最值得肯定的部分是流程顺序:不确定性先触发控制,定级继续推进。下一轮信任检验来自证据链。公众需要看到初步信号如何转化为阈值决定,每项控制如何获得 Critical 级资格,以及哪种新证据会再次触发暂停。
下一步可以直接检查三项公开工件:Astra Capabilities Report、Safety Advisory Group 的决定状态,以及 Critical 级控制的实测结果。在这些证据出现前,运行处置标签应继续与能力定级结论分开。
常见问题
OpenAI 已经确认 Astra 达到 Critical 网络能力了吗?
OpenAI 已公开表示无法排除 Critical,并正按首个 Critical 网络模型管理 Astra。公开渠道尚无正式 Astra Capabilities Report 或 Safety Advisory Group 定级决定。当前证据支持采用 Critical 风险姿态,仍不足以支持外部独立确认的最终定级。
Critical 网络能力具体指什么?
它指模型能够在无人干预条件下,针对许多加固关键系统开发覆盖各严重等级的可用零日漏洞;或者只根据高层目标,对加固目标自主执行新型端到端攻击。
OpenAI 是否停止了 Astra 的全部开发?
公告明确的是暂停尚未达到强化控制要求的内部活动。公开材料没有列出完整活动清单,因此无法据此认定全部研发任务均已停止。
为什么评测还没结束就能先升级控制?
风险控制可以采用保守上界。现有证据无法证明模型低于严重阈值时,先执行更高等级控制,再通过 Deep Dive 收敛定级,能够降低不确定阶段的暴露。
Universal monitoring 足以保证 Astra 安全吗?
监控只是其中一层。完整安全论证还需要隔离、最小权限、工具与网络限制、权重安全、不可修改日志、人工升级、经过测试的中断机制、独立评测和残余风险证据。
参考资料
- Responding to the next frontier of critical cyber capabilities
- OpenAI 官方 Astra 声明
- OpenAI 官方 RSS
- Preparedness Framework v2
- Our updated Preparedness Framework
- GPT-5.6 Cybersecurity and Trusted Access for Cyber
- The Verge:OpenAI puts the brakes on a new model
- The Register:OpenAI pledges to add Astra security