GLM-5.3 的网络风险不能压缩成一个 benchmark 分数。NIST CAISI 与 Anthropic 提供了较强证据,说明这款开放权重模型跨过了重要的漏洞利用能力门槛;攻击者真实增益和现实滥用的证据成熟度仍然更低。更有效的评估方式,是把能力、获取、护栏、增益和现实伤害分开测量。
阅读时间:约 10 分钟 · 约 5000 字
TL;DR
- NIST 将 GLM-5.3 称为其评估过的网络能力最强开放权重模型,并估计它在综合网络评测上落后美国前沿约四个月。
- Anthropic 报告 GLM-5.3 在 410 次 V8 测试中完成 50 次端到端漏洞利用,接近 Claude Mythos Preview 的 56 次。
- 开放权重改变了可获得性:模型可以下载、自托管、修改,并移除拒答机制。
- 护栏绕过率测量模型是否愿意执行,漏洞利用 benchmark 测量模型是否具备能力,两者回答不同问题。
- 现有证据支持能力与获取条件发生显著变化,尚不足以量化普通攻击者的平均增益或可归因现实伤害。
两份研究确认了能力,尚未覆盖完整风险链
NIST CAISI 于 2026 年 9 月 17 日发布 GLM-5.3 评估。Anthropic 在 9 月 29 日公布自己的漏洞利用与护栏测试。
两份资料在核心能力判断上相互支持。NIST 认为 GLM-5.3 是其评估过的最强开放权重网络模型。Anthropic 发现它在 ExploitBench 上接近 Claude Mythos Preview,并显著领先较早的开放权重模型。
这仍不等于两次完全独立复现。NIST 使用四类 benchmark 和时间校正后的综合指标;Anthropic 使用部分相邻的漏洞利用任务、内部二进制利用 benchmark、专家实测和单独的护栏绕过实验。Anthropic 同时是直接竞争者,且自身采用可信访问分发,其政策结论需要明确归因。
| 问题 | 当前证据 | 可信度 |
|---|---|---|
| GLM-5.3 能否完成高级漏洞利用任务 | NIST 与 Anthropic 的 benchmark | 对测试环境较高 |
| 它是否比相近闭源模型更容易获取和修改 | 公开权重与本地修改记录 | 高 |
| 原始拒答能否阻止有害使用 | Anthropic 的绕过与 abliteration 测试 | 对测试方法中高 |
| 它把普通攻击者成功率提高了多少 | 少量专家实测,缺少人群级对照实验 | 中低 |
| 是否已造成可归因现实伤害 | 两份评估均未提供系统事故数据集 | 低 |
这套证据阶梯能阻止一种常见跳跃:从 benchmark 表现直接推导大规模现实伤害。
能力:benchmark 能证明什么
NIST 使用四类任务评估漏洞发现与利用:183 个 SEC-Bench Pro 任务、41 个 ExploitBench 任务、502 个用户态 ExploitGym 任务,以及 297 个私有 CAISI OSS-Fuzz 任务。综合指标考虑任务难度,纵轴每增加 400 分对应解题统计胜算提高 10 倍,并报告 95% 置信区间。
NIST 的结论是:GLM-5.3 在已评估开放权重模型中领先,但综合表现仍落后当前美国前沿约四个月。这个结论依赖 CAISI 的模型集合、benchmark、工具配置和发布日期,不能扩展成所有技术领域都落后四个月。
细分结果能帮助限定结论。CAISI 报告 GLM-5.3 在 SEC-Bench Pro 为 74/183,在 ExploitGym Userspace 为 47/498,在私有 OSS-Fuzz 集为 23/297。ExploitBench 报告的是 16 级能力阶梯的平均 9.8 分,即 61.1%。最后这个数字很容易与 Anthropic 的 12% 结果混淆。
Anthropic 提供了端到端漏洞利用的细节。GLM-5.3 在 ExploitBench 的 410 次尝试中成功 50 次,约 12.2%;Claude Mythos Preview 成功 56 次,约 13.7%。在 Anthropic 内部二进制利用 benchmark 随机抽取的 100 个任务上,GLM-5.3 有 4% 达到完整控制流劫持,Mythos Preview 为 6%,更早的对照模型为零。
这些结果显示门槛发生变化,同时要保留两项限制:任务运行在准备好的离线目标中,单次成功仍不常见。推理便宜、可并行、可重复时,较低的单次成功率也可能产生影响,但运营层放大效应必须另行测量。
获取:开放权重如何改变扩散
能力说明模型在测试里能做什么。扩散还取决于谁能用、使用摩擦多大,以及控制能否被修改。
闭源前沿网络模型可以通过身份核验、速率限制、行为监控、使用政策和可信访问计划限制。此类机制也会带来误报和治理成本,但提供商仍保有执行面。
权重下载后,执行面转移到操作者。用户可以自托管、关闭网络日志、修改系统提示词、微调行为或调整拒答机制。分发还带来持久性:原提供商之后改变政策,也无法召回既有副本。
因此,可获得性应作为一组变量测量:
- 运行模型所需的硬件和内存;
- 下载与托管渠道;
- 推理成本和吞吐;
- 配置 Agent Harness 所需技能;
- 修改拒答与监控的能力;
- 漏洞利用工具、目标环境和长任务执行能力。
这样可以把开放权重的价值判断,转化为可验证的有效获取条件。
护栏:拒答率是另一条测量轴
Anthropic 在模拟环境中测试 GLM-5.3 是否响应明确恶意指令。原始模型在直接请求下全部拒绝;加入虚假红队故事后,64% 的测试开始执行;预填充推理后为 92%;经过 abliteration 的模型达到 100%。每种条件包含 50 个样本。
Anthropic 还报告,abliteration 将三个有害请求 benchmark 的平均拒答率从约 95% 降到 6%,GPQA-Diamond 结果不变,CyberGym 测试子集只下降几个百分点。修改过程约消耗 2200 GPU 小时,估算计算成本约 4400 美元。
这些数字测量控制的耐久性,不能与漏洞利用成功率混为一谈:
- 拒答率回答模型是否尝试有害任务;
- 能力成功率回答模型能否完成技术任务;
- 攻击链完成率回答工具、权限、持续执行和运营决策是否最终造成伤害。
愿意执行但能力不足,现实增益有限;能力很强但直接拒答,也可能通过绕过释放。风险评估需要同时测量两条轴。
增益:测量被改变的攻击链
Anthropic 的专家实测提供了重要案例。一次不超过一天、人工注意力有限的实验中,GLM-5.3 发现并串联多个未知浏览器漏洞,在提供的 Linux 目标上形成可工作的利用链。另一次实验中,GLM-5.3-Flash 根据公开漏洞信息,在八个模型工作小时和约 20 分钟人工投入内生成 ARM64 利用链,报告 API 成本为 20.40 美元。
这些是有力演示,仍不是普通攻击者平均增益的对照估计。
合格的增益研究应把能力相近的操作者随机分配到模型辅助组和对照组,并测量:
- 从选定目标到验证发现所需时间;
- 到达各攻击链阶段的概率;
- 不同环境中的利用可靠性;
- 所需人工技能和注意力;
- 错误线索与验证成本;
- 总计算和工具成本;
- 同等条件下产生的防御发现。
测量单位应是完成且验证的任务,而非 Token、建议数量或 benchmark 分数。同一模型也能帮助防御者更快修补漏洞,净风险还取决于攻防双方的采用速度和响应周期。
滥用:建立独立事故账本
Anthropic 判断国家和非国家攻击者很可能使用 GLM-5.3 这类模型造成现实伤害。这是一项前瞻判断,参考了攻击者使用 AI 的既有报告,但两份核心资料没有提供能够把现实攻击系统归因给 GLM-5.3 的公开事故数据集。
现实滥用账本至少要记录:
- 模型与版本归因置信度;
- 模型是生成、筛选还是仅解释某项动作;
- 目标是否获得授权;
- 到达的攻击链阶段;
- 独立技术证据;
- 防御影响与修复结果;
- 没有模型时的反事实难度。
这能同时避免两类错误:因为尚无公开灾难而忽略可信能力证据,或用模拟测试宣称现实伤害已经发生。
本站此前对 OpenAI Critical 网络门槛的分析聚焦模型分级。本文在此基础上增加了获取和现实增益两条独立变量。
五轴扩散仪表盘
| 轴 | 示例指标 | 更新触发器 |
|---|---|---|
| 能力 | 按任务类型统计的已验证利用成功率 | 新模型或新 Harness |
| 获取 | 成本、硬件、可用渠道、可修改性 | 权重或高效量化发布 |
| 护栏 | 绕过率和移除控制成本 | 新越狱或微调方法 |
| 增益 | 相对对照组的时间与成功率改善 | 对照研究或红队演练 |
| 滥用 | 按攻击链阶段统计的可归因事故 | 经核验事故报告 |
治理动作可以针对真正变化的轴。能力上升需要加强评测,获取扩大需要加快防御修补与监控,护栏失效需要调整分发控制,核实滥用则需要进入事故协同。单一危险度总分会掩盖这些差异。
常见问题
GLM-5.3 的网络能力等同于最强闭源模型吗?
NIST 认为它是已评估最强开放权重模型,同时仍落后美国当前前沿综合水平。Anthropic 在部分漏洞利用 benchmark 上发现它接近 Claude Mythos Preview。两项结论都不能扩展为所有网络任务全面持平。
落后四个月具体是什么意思?
这是 CAISI 根据历史综合 benchmark 建立的估算,描述测试范围内的网络能力前沿,不代表编程、推理或产品质量都存在同样时差。
为什么 NIST 报告 61.1%,Anthropic 只有约 12%?
两者的结果变量不同。NIST 计算 16 级能力阶梯的平均得分,并对每题取三次尝试中的最好结果;Anthropic 统计所有尝试中达到端到端最高利用结果的比例。
100% 绕过是否意味着攻击一定成功?
100% 指经过 abliteration 的模型在模拟条件中全部响应有害指令。真正的技术利用成功率由其他 benchmark 测量,数字低得多。
开放权重为何影响护栏?
操作者可以修改下载后的权重,并在提供商监控范围外运行。提供商侧拒答、限速和访问政策因此更难持续执行,硬件与专业能力仍构成摩擦。
目前最缺什么证据?
主要缺口是攻击者增益对照实验、有代表性的部署经济性、独立护栏复测,以及可归因现实滥用的系统账本。
参考资料
- Anthropic:GLM-5.3 and the spread of advanced cyber capabilities
- NIST CAISI:Assessment of Z.ai's GLM-5.3 cyber capabilities
- Z.ai:GLM-5.3 model card
- ExploitBench 作者:ExploitBench
- Anthropic:Fable 5 cyber safeguards and jailbreak framework
下一轮评估可以问一个更窄、也更能支持决策的问题:攻击链中的哪一步变便宜了,对谁变便宜,幅度是多少?