Administrator
Published on 2026-09-02 / 2 Visits
0
0

Claude Fable 5.1 与 Mythos 5.1:怎样评测安全护栏成本

Claude Fable 5.1 和 Mythos 5.1 提供了一个少见的对照组:Anthropic 明确表示,两者使用完全相同的模型权重,差异来自安全护栏与访问范围。在 Terminal-Bench 4.0 上,Mythos 得分 60.9%,Fable 得分 55.8%。这 5.1 个百分点让护栏带来的系统代价第一次变得可见,但它只能作为待验证信号。真正的选型需要同时核算能力、安全干预、每个可用结果的总成本和访问资格。

资料核验时间:2026 年 9 月 2 日。该版本刚发布,Fable 5.1 与 Mythos 5.1 的大部分数据仍来自厂商披露。本文使用 Terminal-Bench 官方资料和上一代 Fable 5 的独立研究限定结论边界。

相同权重,不同运行边界

Anthropic 发布说明把两者定义得很清楚。Fable 5.1 面向一般用户开放。Mythos 5.1 放宽部分网络安全和生命科学护栏,只通过可信访问计划提供给经过审核的组织。

差别发生在完整运行栈里。系统卡披露,Fable 的网络安全流量先经过内部激活探针,再交给独立 LLM 分类器决定是否阻断。在多数产品界面中,触发分类器的请求会回退到 Claude Opus 4.8。Mythos 则让合格用户访问更少受限的同一底座能力。

因此,一个 Fable 分数可能混合三种结果:Fable 5.1 直接完成、Opus 4.8 回退完成、任务被阻断。Mythos 分数则反映更宽松策略下的同一组权重。可比较对象应该是完整配置,包括模型、分类器、回退模型、Harness、推理强度、访问计划和预算。

5.1 个百分点能证明什么

Anthropic 使用 Claude Code bare mode 和最高推理强度运行 Terminal-Bench 4.0。Mythos 5.1 每题运行 10 次,得分 60.9%;Fable 5.1 每题运行 15 次,得分 55.8%。系统卡给出的单模型标准误为 1.6 至 2 个百分点。

发布页还给出一个决定性限制:Anthropic 将这段差距归因于较早、精度较低的网络安全护栏介入,并预计随 Fable 5.1 同期上线的新护栏会让差距明显缩小。已公布分数能证明护栏层会改变任务成功率,但不能直接估计当前线上护栏的稳定税率。

这个结果支持三层判断。

第一,同样的权重在不同安全策略下会产生不同的 Agent 任务通过率。排行榜分数属于完整系统,而非模型常数。

第二,5.1 个百分点值得调查,但仍是一个带不确定性的样本估计。它无法直接外推为所有任务、所有产品界面和所有护栏模型的固定税率。

第三,Terminal-Bench 的总分无法单独分离分类器影响。4.0 版本包含 66 个工程、科学、生命科学、形式化方法、安全与业务任务。总分没有逐题公开区分护栏阻断、回退、普通能力失败和成本变化。

这套基准本身已经比很多旧排行榜更稳健。Terminal-Bench 4.0 官方说明记录了 8 个删除任务、19 个修复任务、统一 8 小时时限,以及 CPU 和内存校准。官方同时指出,剩余错误主要来自模型拒绝和输出 Token 超限。这恰好说明:拒绝应该作为独立结果统计,不能被压进一个准确率数字。

上一代模型的独立研究进一步展示了问题规模。一篇覆盖八个生物医学基准的预印本发现,Fable 5 的拒绝率随数据集不同,在 8.0% 到 99.4% 之间变化。排除拒绝项后,其准确率达到或超过研究中的对照模型。该论文不能证明 Fable 5.1 的拒绝率,却证明了一个方法论事实:聚合准确率会把能力与是否愿意执行混在一起。

护栏成本需要四本账

第一本账:保留下来的能力

冻结一组代表真实生产的任务,使用可执行检查验证最终结果。记录 pass@1、多次运行的一致性和逐题回归。模型版本、系统提示、工具、Harness、推理强度、环境与预算都要写入运行清单。

评测需要回答一个窄问题:部署策略下,多少有用能力真正抵达用户。公开榜单只负责产生候选,生产任务负责决定差异是否有价值。

第二本账:安全干预

至少把结果拆成五类:请求模型直接完成、对禁止任务正确拒绝、对良性任务误报、由其他模型回退完成、与护栏无关的普通失败。

Anthropic 公布了两个分母不同的数据。发布页称,相比 Fable 5 的旧护栏,Claude Code 用户每次会话遇到的网络安全护栏干预平均减少约 60%。系统卡对生产安全编码流量抽样后,给出 Fable 5.1 分类器触发率 1.03%,Fable 5 为 15.0%,Opus 5 为 0.61%,Sonnet 5 为 0.52%。前者统计会话级干预,后者统计特定流量样本中的分类器触发。两个指标方向一致,但不能互换。

安全侧还需要硬门槛。系统卡的自动红队实验中,Fable 5.1 在攻击性任务上的成功率为 4.6%,Fable 5 为 4.5%,Opus 5 为 8.5%。良性误报下降只有在危险任务控制仍满足组织预设阈值时才构成改进。

第三本账:每个可用结果的成本

Fable 5.1 将缓存读取价格下调 75%,降至每百万 Token 0.25 美元;普通输入和输出价格保持每百万 Token 10 美元与 50 美元。Anthropic 估算典型工作负载成本下降约 25%,高度 Agent 化的工作负载最多下降约 45%。该估算基于 2026 年 8 月四周、默认推理强度下的实际使用数据,收益高度依赖缓存读取占比。

独立评测显示了这个估算的适用边界。Artificial Analysis 在 max effort 下测得,Fable 5.1 每个 Intelligence Index 任务成本为 3.76 美元,比 Fable 5 的 3.14 美元高 20%,原因是输出 Token 约为后者的 1.7 倍。切换到 xhigh effort 后,Fable 5.1 每任务成本降至 2.72 美元。缓存折扣真实存在,推理强度和输出长度仍能在特定 Harness 中反转总体方向。该评测还报告,安全回退贡献了约 4% 的 Fable 5.1 输出 Token,说明回退属于成本主体,而非可以忽略的边缘事件。

单价无法覆盖完整的护栏成本。更有用的口径是:

每个可用任务总成本 = 主模型 Token + 回退 Token + 重试 + 延迟成本 + 人工复核 + 访问运营成本

分类器阻止一次危险动作时,额外摩擦具有明确价值。分类器误报一段长时间编码任务时,可能同时增加 Token、延迟、复核和缺陷成本。因此,财务核算单位应该是通过验收的结果,而非每百万 Token。

第四本账:访问与治理

Mythos 5.1 当前只提供给经过审核的网络防御和生命科学用户,初始范围限于一批美国组织。资格审核、日志、复核和使用限制本身就是产品能力的一部分。一个无法获得或无法合规运行的高分配置,没有部署价值。

大量普通团队仍会选择 Fable 5.1,因为日常任务很少进入受限区。只有当合法业务持续触发 Fable 护栏、组织能够取得可信访问资格,并且额外能力通过本地安全与成本评测后,Mythos 才成为合理候选。

一套可复算的评测协议

先建立四类任务池:普通良性工作;有明确授权的双重用途工作;只在合规红队环境运行的禁止任务;接近真实生产流量的模糊边界任务。

每个任务从冻结状态重复运行。记录请求模型、实际服务模型、分类器决定、回退、最终结果、Token、延迟、人工复核分钟数和验收状态。报告逐题配对结果,而非只给两个平均数。

决策看板至少包含:可用任务率与重复一致性;良性干预率与回退率;作为硬门槛的禁止任务控制率;每个可用任务的成本和 P95 延迟;人工复核时间与升级率;置信区间和仍有争议的任务。

评测前先写决策规则。例如:所有关键安全测试必须通过;高价值良性任务的退化不得超过阈值;候选配置必须降低每个可用任务的总成本。它是在既有的AI Agent 评测框架按任务形状路由模型的方法之上,新增一份专门的护栏账本。

这组对照真正有价值的地方

Fable 与 Mythos 提供了一个有价值的控制变量:相同权重,不同运行策略。它带来的核心启示是,模型智力、安全干预、总成本和访问资格必须进入同一份测量合同,因为生产用户会同时承受四者。

60.9% 对 55.8% 是启动本地评测的信号。它不能支持给所有安全模型统一扣除 5.1 分,也不能支持护栏越少、系统越好的结论。更好的系统应在明确安全阈值内,以可接受的总成本完成经过授权的工作,并让每一次阻断、回退与失败都能在日志中被复算。

常见问题

Fable 5.1 和 Mythos 5.1 是两个不同模型吗?

Anthropic 表示两者使用相同权重,差异来自特定领域的安全护栏和访问范围。Fable 面向一般用户,Mythos 面向经过审核的网络安全与生命科学用户。

5.1 个百分点就是护栏成本吗?

它是特定 Terminal-Bench 4.0 配置下观察到的总分差。任务构成、运行次数、标准误、回退机制和分类器干预共同限定了这个结果。生产护栏成本需要逐题拆解。

Fable 5.1 的误报真的比 Fable 5 少吗?

Anthropic 系统卡显示,抽样生产安全编码会话的分类器触发率明显下降;发布页还报告 Claude Code 每会话干预减少。两者都是厂商数据,分母不同,适合在本地流量中分别监测。

缓存降价能抵消护栏成本吗?

缓存密集型任务会降低 Token 费用。回退、重试、延迟、人工复核和合法任务被拒绝的成本仍然存在,因此需要核算每个可用结果的总成本。

为什么独立评测会显示每任务成本上升?

缓存占比、输出长度、推理强度、Harness 和任务构成都会改变最终账单。Artificial Analysis 的 max effort 测试中,额外输出 Token 抵消了缓存折扣。它与 Anthropic 默认推理强度下的典型负载估算回答的是两个不同问题。

所有安全团队都应该申请 Mythos 5.1 吗?

当经过授权的真实任务反复触发 Fable 边界,并且组织能够履行可信访问义务时,申请才有价值。处于 Fable 允许范围内的一般安全辅助任务,可能得不到足以抵消治理成本的收益。

参考资料


Comment