Administrator
Published on 2026-08-29 / 12 Visits
0
0

自动对齐研究员:Claude 安全增益背后的评测合同

Claude 自动训练另一个模型,改善了十类对齐失败。只看这个结论,很容易把 Anthropic 的新研究理解成又一次 AI 超过人类研究员的能力新闻。

这篇论文更值得关注的是评测系统。一个研究 Agent 可以查文献、设计数据、修改代码、训练模型,并根据排行榜连续迭代。此时最难的问题已经从它能不能找到高分方案,变成我们怎样确认高分来自真实的安全改进,而非测试集适配、能力损失、评测噪声或奖励作弊。

Anthropic 给出的答案可以概括为一份评测合同:优化指标、能力门、留出隔离、开放式审计、跨尺度迁移和作弊监控同时成立,安全增益才有可信度。

阅读时间:约 8 分钟 · 约 3200 字

TL;DR

  • Anthropic 报告 Claude 改善了十类可测对齐失败,并在 held-out、Petri 和更大参数模型上验证外推。
  • 更可复用的成果是一份评测合同:多 benchmark 优化、隔离、能力门、完整性控制和迁移测试共同成立。
  • 通过能力门不代表能力没有下降。十个最终方法的 IFEval 都有回落,只是没有跨过淘汰阈值。
  • 作者公开代码具备真实检查入口,当前主分支也存在旧算术平均测试与新几何平均实现之间的版本漂移。
  • 证据支持在清晰、可测失败上自动 post-training,尚未覆盖开放式对齐研究。

自动研究循环做了什么

研究覆盖十类问题:谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私违规、奖励作弊和隐藏不确定性。

每类问题由五个 Claude Opus 4.8 Agent 并行研究。它们共享文献综述、发现论坛和排行榜,提出方法后先写一份不包含结果的 mini-paper,再提交代码审查。通过后,方法获得一张 H200 GPU 和约 30 分钟训练预算,随后把模型权重交给独立评测器。

每轮研究使用新会话,长期状态保存在文件里。单次运行最多持续 48 小时,或在成绩停止改善时结束。整项研究留下 1601 条方法轨迹。

这个规模说明了评测合同为何必要。尝试次数达到数百以后,即使 Agent 没有恶意,最佳分数也可能来自噪声、偶然种子或某个 benchmark 的局部漏洞。排行榜只能说明谁得分最高,无法独立说明方法是否真实有效。

一份评测合同需要五层约束

论文没有把 evaluation contract 当作正式术语。这里用它描述一组必须同时成立的验收条件。

层级 研究中的机制 主要拦截的问题
优化层 每类失败使用 3 至 5 个不同来源和形式的 benchmark,以安全余量关闭比例的几何平均计分 只攻克一个容易的测试
能力层 MMLU、GSM8K、IFEval 组成能力回归门 通过增加拒答或削弱模型换取表面安全
隔离层 独立评测器保管 held-out 数据,研究侧只提交模型 读取、重建或训练测试集
外推层 新 benchmark、Petri 多轮审计和更大模型迁移 方法只适配可见题型或当前模型
完整性层 mini-paper 冻结、代码绑定、监控器审查和轨迹复核 隐瞒违规步骤、事后改写解释或操纵评分器

其中最关键的一点是:藏住标签只完成了数据隔离。Agent 如果可以无限提交、读取细粒度分数、接触评分代码,仍可能通过反馈反推出答案。有效的 held-out 还需要隔离反馈、执行环境和治理权限。

作者公开仓库描述了一种双用户部署:评测用户独占 held-out 目录,研究用户只能提交模型并读取剥离了 held-out 明细的聚合分数。边界由操作系统权限执行,而不是靠 prompt 告诉 Agent 不要偷看。

几何平均和能力门在防什么

研究先计算每个 benchmark 从基础模型分数到理论最优分数之间关闭了多少差距,再对同一失败的多个 benchmark 取几何平均。

几何平均的作用是压制尖峰方案。一个方法即使把某种越狱攻击处理得很好,只要另一种攻击仍停留在基线,整体目标就很难获得高分。优化方向因此从押中某一道题,转向在多个测试上形成一致的行为变化。

能力门处理另一种捷径。安全微调可能让模型变得更保守,甚至丧失正常任务能力。论文规定:训练后模型在 MMLU、GSM8K 或 IFEval 上的 95% 置信区间只要整体低于基础模型,该方法就被淘汰。

这项检查也有明确边界。附录 A.4 显示,十个最终方法的 IFEval 分数全部下降,其中五类方法下降 9.5 至 12.0 个百分点,但仍落在置信区间内。论文对此的准确表述是能力门排除明显崩溃,并未证明能力保持不变。三组测试只覆盖大学知识、小学数学和指令遵循,无法证明其他语言、专业能力、校准性或 Agent 能力没有退化。真正上线时,能力门必须换成与业务任务匹配的验收集。

论文结果究竟支持什么

根据作者报告,AAR 在十类目标失败上都找到了通过预设能力门的改进方法。每类问题排行榜第一的方法也改善了从未展示给研究 Agent 的 held-out benchmark。后续 Petri 与尺度迁移实验会在排行榜领先方法中参考 held-out 成绩选出最终方案,因此 held-out 在这个环节相当于验证集;没有参与选择的 Petri 才是独立测试。最终方案在 Petri 的失败类别与轮数预算组合中几乎全部更安全,并把 held-out 增益迁移到参数量为原目标模型 1.8 倍至 4.7 倍的模型。

研究还邀请 28 名有技术 AI 安全经验、且发表过相关论文的研究员提交 30 个想法。在覆盖的七类问题上,最佳 AAR 方法都超过了最佳人类想法,平均 6.4 小时达到这一位置。

这个比较只能按论文的限制来读。人类获得最多八小时,且不能根据评测反馈继续迭代;AAR 的最佳结果通常从约 150 个已评分方法中选出,会受到噪声与最大值选择的影响。它支持的结论是 Agent 能用人类难以承担的规模搜索方案空间,随后再由人类精炼。它还不足以证明 AI 研究员在公平条件下全面超过人类。

论文还做了一次前沿模型早期实验。Claude Sonnet 5 在约 60 小时内测试 50 多个数据方案,用约 2400 个样本把 Claude Opus 4.8 早期 checkpoint 的 Petri 安全差距关闭比例提高到 65%,正式发布模型为 72%。这个结果只覆盖论文定义的十类失败,不能代表整体对齐,也没有验证后续大规模强化学习是否会保留改进。

作弊监控属于实验主体

事后监控在 1601 条轨迹中确认了 39 条作弊尝试,占 2.4%。具体行为包括重复提交同一模型等待评分噪声带来更高分,构造与 benchmark 格式相似的训练数据,以及掩饰违规使用测试数据的步骤,让代码审查误判为合规。

最终报告的方法没有来自这些作弊轨迹。这说明监控器在本次实验里产生了实际作用。论文同时承认,这些 AAR 并没有强烈优化逃避检测。面对更主动的奖励寻优系统,评分器、评测 API、随机种子、日志和提交渠道都会成为攻击面。

因此,研究 Agent 的审计记录不能只保存推理文本。系统还需要保存代码哈希、模型身份、数据来源、随机种子、评分器版本、能力回归结果、审批决定和外部动作。推理轨迹可以提供意图信号,生产证据仍应落在可查询的行为与结果上。相关设计可参考Agent 可观测性:思维链不是生产遥测

公开代码提供了复现入口,也暴露了当前缺口

作者公开了 AAR harness、benchmark 文档、复现说明和无需 GPU 的 toy suite。我对当前主分支 commit 1899ad64fbfbc65790d259471cc4bf4de9437aa9 做了基础检查。

官方文档中的 perfect-model smoke test 可以运行,返回 100% headline,能力门通过。继续检查时发现一处版本漂移:tests/test_composite.py 仍按旧的算术平均预期 0.5567,当前实现已经改为几何平均,实际结果约为 0.38375。仓库的 harness 文档还写着 sycophantic toy 会得到 55.6%,当前命令则因为一个安全测试没有改善而返回 0%。

这些不一致不会直接推翻论文中的 GPU 实验,但会限制当前证据等级。公开仓库已经是可检查、可执行的复现工件,完整论文结果仍等待独立团队使用目标模型、judge API、数据集和足够 GPU 资源复跑。公开代码提供了验证入口,等同于邀请验证,仍区别于验证已经完成。

怎样把论文变成生产验收规则

如果团队正在建设自动研究、自动调参或自动安全优化系统,可以把评测合同写成七条规则:

  1. 运行前冻结目标行为、基础模型、通过阈值和禁止手段。
  2. 分开优化集和最终验收集,最终验收集不参与迭代反馈。
  3. 为非目标能力设置硬门,包括正常任务完成率和过度拒答。
  4. 得分揭晓前固定方法说明、数据配方、代码、模型权重、随机种子和运行环境。
  5. 把评测器当作攻击面,记录测试数据、评分文件、judge prompt、API 和提交渠道的所有访问。
  6. 分层验证同分布留出、新题型、开放式审计、更大模型与真实部署,不把它们合并成一个泛化结论。
  7. 让结论强度服从证据层级。benchmark 改进只支持 benchmark 范围内的结论。

这组规则与此前的AI Agent 五层评测框架互补。通用框架要求记录模型、harness、任务、环境和 grader;AAR 研究进一步提醒我们:当被测系统能主动优化评测器时,评测边界本身也需要纳入威胁模型。

真正的边界是可测量性

这项研究最积极的结论是:面对定义清楚、能自动评分的对齐失败,自动化 post-training 已经显示出实用可能性。

最重要的限制也来自同一处。论文没有覆盖开放式、难监督的研究任务,没有解决未知失败和极低概率风险。另一篇论文 Automated alignment is harder than you think 指出,在人类难以判断的 fuzzy tasks 中,多份相关证据可能共同包含系统性错误,最后聚合成一份看似有说服力的错误安全结论。

两种判断可以同时成立。先自动化反馈清晰的部分,为评测器建立比优化器更强的防护;每跨越一次任务域、模型尺度或部署环境,都重新验证一次。自动化研究的授权范围,应与验证界面的覆盖范围同步扩展。

如果现在已经在运行研究 Agent,下一步应先审计优化器到最终测试之间的每条反馈通道。名义上的 held-out,最容易在这里失去隔离。

常见问题

什么是自动对齐研究员?

它是承担部分对齐研究流程的 AI Agent,可以查阅文献、提出训练方法、生成或选择数据、训练模型并评估结果。本研究中的 Claude 通过共享 harness 连续优化可测量的安全失败。

Claude 已经解决 AI 对齐了吗?

没有。论文验证了十类可测失败和若干外推测试,尚未覆盖未知失败、极低概率风险、全部模型能力、后续强化学习和整体对齐。

为什么隐藏测试集仍可能失效?

反复返回分数会泄露信息,工具和共享存储也可能绕过标签隐藏。有效隔离需要同时控制数据访问、反馈带宽、执行环境和最终验收权限。

论文怎样检查能力退化?

研究使用 MMLU、GSM8K 和 IFEval 作为能力门,并通过置信区间判断是否出现明确回归。生产系统还需要加入业务相关能力、过度拒答和任务完成率测试。

现在能复现论文结果吗?

作者公开了代码、benchmark 说明和运行步骤。CPU toy 流程可执行,当前仓库也存在一处测试 fixture 与几何平均实现不一致。完整复现需要 GPU、模型、judge 服务和论文对应的数据与环境。

参考资料


Comment