Claude 新公布的两项密码分析结果,不能只用 AI 攻破密码学来概括。HAWK 攻击有可运行的密钥恢复代码,方案团队公开确认后退出 NIST 候选流程;AES 结果针对 7 轮研究变体,完整攻击成本高到无法端到端执行,当前主要依靠证明、缩小实验和组件测量建立可信度。
两项工作最重要的共同点,是把 AI 科学发现的验证问题摆到了台前。模型给出新想法只说明值得调查。可运行工件、独立复核、受影响团队确认和标准机构行动,才把想法逐级变成可以依赖的知识。
先把两项结果分开
Anthropic 在 2026 年 7 月 28 日发布研究说明。两项工作都使用 Claude Mythos Preview 和 Agent harness,让模型检索论文、提出假设、运行 Python 与 Sage 实验并保存中间结果。但攻击对象、实际影响和验证方式完全不同。
HAWK:影响了一个真实标准候选
HAWK 是 NIST 额外后量子数字签名标准化流程的第三轮候选。Anthropic 的技术论文把密钥恢复问题降到 n/2 + 1 维精确最短向量问题。按论文采用的门计数口径,HAWK-512 的密钥恢复成本由 2^150 降至 2^108,HAWK-1024 由 2^288 降至 2^182。
较大参数仍然远超现实算力。结果的杀伤力来自产品定位:HAWK 的优势建立在紧凑参数与效率上,简单扩大参数会消耗这些优势。Anthropic 同时发布了研究代码,可以在单台服务器上用数小时完成 HAWK-256 挑战实例的密钥恢复。
关键证据随后来自 Anthropic 之外。7 月 29 日,HAWK 团队在 NIST PQC Forum 确认,该攻击大约把格规约所需的 block size 减半;扩大参数或提高 module rank 会使 HAWK 失去竞争力,因此撤回候选。NIST 的第三轮页面已经记录撤回状态。
边界同样清楚:HAWK 尚未成为标准,也没有进入生产部署。攻击不影响 Falcon、ML-DSA 或整个格密码体系。用户无需因此迁移现有 AES 或后量子算法。
AES:技术进展成立,现实威胁不成立
生产使用的 AES-128 有 10 轮。Claude 改进的是密码学研究中常用的 7 轮弱化版本。研究弱化版本的目的,是理解安全余量和新攻击技术,并不代表完整算法已经失守。
Möbius Bridge 论文改进了 2013 年的一类 meet-in-the-middle 攻击。新方法消除一个 key byte 猜测,把估算时间从约 2^99 降到 2^89.3 至 2^91.4,仍需 2^105 个 chosen plaintext。不同计费口径下,速度提高约 200 至 800 倍。
论文提供了多层验证:关键不变性的数学证明、拒绝分析所用计数边界的 Lean 形式化、缩小实例的穷举、玩具密码上的完整攻击,以及攻击组件的实测。问题在于,目标 7 轮攻击的成本仍然无法实际运行;截断表的假阳性率和错误密钥随机化模型仍包含经验性假设。
密码学家 Matthew Green 在独立评论中强调了这个差别:HAWK 的核心结论可以交给代码直接复现;AES 是有价值的纸面改进,但验证成本更高,当前证据强度低于 HAWK。
一条五级证据阶梯
面对 AI 生成的新结果,可以用五层证据限制结论强度。
| 层级 | 证据 | 可以支持的结论 | 本次例子 |
|---|---|---|---|
| 1. 候选发现 | 对话记录、假设、草稿推导 | 值得继续调查 | Claude 最初提出的攻击思路 |
| 2. 可复现工件 | 代码、固定输入、测试向量、小型证书 | 指定组件在声明条件下工作 | 公开的 HAWK、AES、LEA 代码 |
| 3. 结构化验证 | 证明、形式化检查、缩小实例、组件基准 | 核心机制通过了定向检查 | AES 的 Lean 检查与玩具实例 |
| 4. 外部确认 | 外部专家复现或受影响团队确认 | 可信度跨出原始实验室 | HAWK 团队公开确认 |
| 5. 制度性结果 | 标准状态、补丁、勘误或政策变化 | 证据已经改变被治理系统 | HAWK 撤回,NIST 页面更新 |
这五层不是一条机械打分表。形式化证明可能精确证明了错误命题;端到端演示可能只覆盖一个缩小参数;标准机构也可能出于谨慎采取行动。正确用法是先声明证据类型,再给出它能承担的结论。
HAWK 可以说已经端到端演示、由方案方确认并产生制度性结果。AES 可以说关键机制经过论文作者的多种结构化验证。把两者统一写成 Claude 攻破两个密码算法,会同时夸大 AES 并抹掉 HAWK 真正强的证据链。
为什么可运行工件能大幅降低验证成本
HAWK 的中心错误能够被观察。复核者选择挑战实例,运行代码,检查是否恢复等价密钥,再验证它能否完成签名。复杂数学最终落到一个成本相对低、结果明确的验收接口。
AES 的结论属于另一种形状。完整攻击无法运行,复核者必须逐段检查复杂度换算、定理口径、形式化命题、缩小实验和组件组合关系。每一层都增加信心,但缺少单一、决定性的端到端信号。
这与之前数学 Agent 双循环协议讨论的是同一个瓶颈:探索过程可以开放、并行且非确定;进入可信知识库的结论必须走固定门槛。AI 提高了候选生成速度,也把系统瓶颈推向了验证接口设计。
把证据阶梯变成研究流程
冻结目标和边界
在搜索开始前写清目标、假设、威胁模型、参数集、对照基线和成功条件。7 轮 AES 结果不能在后续传播中漂移成生产 AES 风险。挑战实例恢复也要说明它与正式参数的关系。
把发现和验证拆成两条链
发现链追求覆盖面:读文献、生成假设、跑实验、寻找反例。验证链追求找错:使用冻结输入和新上下文,检查代码、证明、成本口径与组合关系。让原 Agent 自我评价只算自检,无法替代独立证据。
强制交付验证接口
研究结果应同时提供测试向量、确定性脚本、形式化文件、最小反例或组件 benchmark。提交记录、工具版本、随机种子、硬件和输入也属于结果的一部分。论文里的关键主张最好都能落到更小的可执行对象。
在强结论前引入外部复核
同一实验室内部检查容易共享假设和激励。方案作者、标准机构、不同研究团队和独立实现提供了不同的错误传感器。HAWK 已经越过这条边界;截至 2026 年 8 月 10 日,AES 结果公开可见的独立确认仍较少。
给标题附带证据标签
可以采用候选、组件已验证、端到端已演示、外部已确认、已产生制度行动等标签。新增复现或反驳出现时,只需更新证据层级,无需重写历史。这比发布与撤回两个二元状态更适合高速 AI 研究。
新瓶颈是专家验证吞吐量
Anthropic 报告 HAWK 发现过程耗时约 60 小时,API 成本约 10 万美元。AES 的核心发现经过数日和约 10 亿输出 token,随后两名研究人员用了数百小时建立信心。这些数字来自厂商自己的披露,适合描述实验规模,无法直接证明同类研究的普遍成本。
更稳健的结论是:候选结果的生成速度已经可能超过专家审查速度。继续增加模型推理,会同时增加真结果和高度逼真的伪结果。缺少验证接口的团队得到的不是科研产能,而是审稿债务。
此前的 OpenAI 单位距离问题案例也显示,AI 产出只有进入外部数学验证流程后,才具备科学意义。密码学还多一层安全约束:未来若模型发现影响生产系统的漏洞,公开复现之前还需要负责任披露、修复窗口和跨机构协调。
常见问题
Claude 攻破 AES 了吗?
没有。研究改进了针对 7 轮 AES-128 的攻击。生产 AES-128 使用 10 轮,而且该攻击需要不现实的数据量与计算量。
Claude 攻破 HAWK 了吗?
它发现的攻击显著削弱了 HAWK 拟议参数,使方案失去标准竞争力。HAWK 团队确认后撤回候选。HAWK 尚未成为生产标准。
这两项研究算全自动完成吗?
Anthropic 把 HAWK 描述为带项目管理指导的半自主工作,把 AES 发现描述为在研究人员搭好 harness 后接近全自主。人类仍然选择目标、提供基础设施、验证结果、撰写论文并协调披露。
有 Lean 证明就足够了吗?
Lean 能验证形式化命题在声明假设下成立。专家仍需核对形式化命题是否等价于真实密码学主张、复杂度模型是否合理、实现是否保持证明中的性质。
HAWK 结果最强的证据是什么?
公开代码可以恢复挑战实例密钥;论坛上出现了公开的外部数学检查;HAWK 团队明确确认并撤回候选;NIST 官方页面随后更新状态。这是一条从技术工件延伸到制度结果的强证据链,但公开记录并未显示第三方完整复跑了整套 HAWK-256 实现。
参考资料
- Anthropic:Discovering cryptographic weaknesses with Claude,2026 年 7 月 28 日。
- Zygimantas Straznickas、Stephen A. Weis:HAWK-n Key Recovery Reduces to SVP in Dimension n/2 + 1,2026。
- Milad Nasr、Nicholas Carlini:Cryptanalysis of 7-Round AES via the Algebraic Structure of its S-box,2026。
- Anthropic:Cryptography Research Demo,2026。
- NIST PQC Forum:HAWK 攻击讨论与撤回声明,2026 年 7 月 28 至 29 日。
- NIST CSRC:Round 3 Additional Digital Signature Schemes,核验于 2026 年 8 月 10 日。
- Matthew Green:Some thoughts about Anthropic's new cryptanalysis results,2026 年 7 月 29 日。
- Jonas Geiping 等:CryptanalysisBench: Can LLMs do Cryptanalysis?,2026。