生命科学 AI 容易出现三种概念混用:模型在 benchmark 上变强,被理解成可以开放更多权限;研究机构通过资质审核,被理解成输出值得信任;一批分子进入湿实验,被理解成计算设计已经得到验证。
这三件事分别回答三个问题:系统能做什么,谁可以在什么范围内使用,输出能否在物理世界成立。它们需要三道独立门禁,也需要一条共同证据链。
Anthropic 在 2026 年 9 月 17 日发布的三组材料,刚好把这套结构摊开了:Claude 优化了 30 多个开源生物分子模型;Life Sciences Verification Program 开始按机构、用途和风险授予更宽松的模型访问;Anthropic 与 Adaptyv 计划为 5000 多个蛋白设计做湿实验。真正值得研究的不是某个数字,而是三种验证之间的边界。
先确认三件已经发生或尚未发生的事
第一件事是计算工具优化。Anthropic 的技术报告覆盖 36 个实现,对应 30 多个结构预测、蛋白设计、基因组和蛋白语言模型。Claude 在两名具备生物分子建模经验的 Anthropic 研究人员监督下,用不到四周完成这些优化。
报告给出的核心口径包括:
- Exact 模式在 14 个结构预测模型上平均把 forward pass 加速 1.6 倍,目标是在确定性设置下保持逐 bit 一致。
- Fast 模式覆盖 13 个模型,平均加速 4.1 倍,允许小幅数值差异。
- 在 1925 个模型与目标组合中,默认、Exact、Fast、Big 四种配置得到可接受界面的比例分别是 54.8%、55.0%、54.5% 和 54.2%。三种优化模式与默认配置的总体差异都没有排除零的 95% 置信区间,但报告明确承认,小幅精度损失仍不能排除。
- Big 模式在单个 8 GPU 节点上准确预测了若干超过 10000 token 的系统,也完成了最高 70320 个残基的推理。后者的结构全部塌缩,结果并不准确。
第二件事是访问治理。Anthropic 的 Life Sciences Verification Program 会检查申请方的研究资质、安全标准和伦理监督,再授予 Standard Use 或 High-risk Use。
Standard Use 面向团队的日常生命科学工作,每年续期。High-risk Use 是绑定具体项目的附加权限,每六个月续期,可以解除生命科学请求上的阻断,但网络安全等其他分类器仍然保留。项目上线时,Opus 5 和 Sonnet 5 已可申请高风险权限;Mythos 的高风险权限仍只向经过额外审查的少量实体开放。
第三件事是湿实验计划。Anthropic 与 Adaptyv 蛋白设计竞赛计划合成和测试 5000 多个入选设计,并公开成功和失败结果。这里的时态很重要。Anthropic 当前报告中的新一批 binder 结果仍是 in silico 评分,报告明确写明尚未进行实验测试。竞赛建立了第三道门,但门后的数据还没有产生。三道门是本文从三组材料归纳出的分析框架,Anthropic 没有把它作为正式标准发布。
第一扇门:能力证据验证系统是否完成了声明任务
能力验证需要冻结评测合同。模型版本、上游代码、硬件、输入规模、batch、计时范围、精度指标、随机种子和对照配置都应该写清楚。否则,四倍加速只是一个无法复算的营销数字。
这次材料的价值在于报告和开源仓库都提供了较细的验证接口。仓库按模型保留基线版本、环境、变更记录、测试和不同优化模式。审阅者可以检查某个具体模型的修改,而不必整体接受 Claude 优化 30 多个模型这个大命题。
报告也保留了足够多的失败信息:
- 性能与显存结果主要来自固定版本和 NVIDIA H100,换硬件、输入和上游版本后可能变化。
- ColabFold 的对照版本是 1.6.1,没有纳入同期新增的可选融合 kernel。
- Exact 与 Fast 的显存占用最高可能达到默认配置的 3.2 倍。速度更快和更容易部署属于两件事。
- 部分上游模型在生产设置下本身就无法逐次复现。
- 基因组与蛋白语言模型主要检查优化输出是否接近默认输出,没有测量下游生物学有效性。
- Big 模式可以扩大可计算范围,却无法让模型自动获得训练分布之外的泛化能力。
公开工件仍没有跨过独立复现这一层。优化、benchmark、数据分析和报告发布主要由 Anthropic 完成。仓库定位是 reference release,不是持续维护项目;多数模型权重需要按上游许可证另行获取。技术报告公开了代码,却没有放出全部派生 benchmark 数据、运行日志和 headline binder 设计集。
最后一条尤其关键。推理成功、指标持平和生物学成立是三个层级。70320 个残基的任务成功跑完,只证明系统跨过了计算门槛;预测结构塌缩说明它没有跨过模型能力门槛。
第二扇门:访问验证决定谁能在什么范围内使用
能力 benchmark 无法回答权限问题。访问验证需要绑定身份、机构、用途、风险等级和有效期。
LSVP 有几个值得借鉴的设计:
- 日常团队权限与例外项目权限分开。
- 每份授权绑定申请时声明的用途。
- 高风险权限缩短续期周期。
- 流量持续与声明用途进行比对。
- 机构管理员负责在约定时限内分诊和处置异常。
代价同样明确。为了识别跨请求、跨会话的行为模式,LSVP 将部分控制从实时阻断改为离线监测,并要求相关流量保留 30 天。Anthropic 表示,这些数据会隔离存放,不用于模型训练,也不会向生命科学研究团队开放。
这套机制提供的是责任和异常检测,并不消除风险。Anthropic 把账号接管、内部人员滥用和 Agent 误用列为三类主要威胁。合格机构的账号仍可能被盗,合格员工仍可能越权,长任务 Agent 仍可能偏离预期。授权记录必须能回答谁应当处理异常、按什么范围判断越界、何时暂停权限。
上线边界也需要单独记录。当前 LSVP 是团队和机构 beta,不支持第三方平台,也不适用于启用 BAA 的组织。Anthropic 明确要求处理受保护健康信息的客户使用独立的非 BAA 组织,并且只放入非 HIPAA 数据。这属于硬数据边界,不能藏在采购说明里。
第三扇门:湿实验验证计算结论能否进入物理世界
计算分数用于筛选候选,无法合成蛋白,也无法测量真实结合、稳定性、毒性和可制造性。湿实验之所以是独立门禁,是因为真实生物系统包含模型和评分函数没有表示的失效模式。
竞赛方案里有几项重要约束:
- 入选设计不会只看单一
in silico指标。 - 提交前必须由研究人员审阅。
- 只有一部分设计会进入实验,参赛本身不代表获得验证。
- 被测试设计将公开序列、预测结构、设计方法、实验测量和负结果。
- 提交、实验和结果发布是三个分开的阶段。
负结果公开决定了这批数据能否成为真正的反馈闭环。如果榜单只展示成功 binder,外部研究者无法估计设计流程的假阳性率。把计算分数和失败实验放在一起,才能识别哪些目标类型容易失效,哪些排序指标存在系统偏差,以及下一版模型是否提高了真实命中率。
选择过程本身也是证据的一部分。竞赛只测试入选设计,并计划用 Claude-based workflow 参与选择。选择规则、总提交量、目标分层和失败定义公开之前,这批被测试样本还不能无偏估计整条设计管线的命中率。
独立研究能够支持三道门的必要性,但没有复现 Anthropic 的新结果。已经发表的 FoldBench benchmark显示,结构预测性能会随任务类型和数据相似度明显变化。另一项覆盖 3766 个实验 binder 的元分析表明,ipSAE 等计算指标适合作为排序信号,但它们仍是随 target 变化的湿实验成功率代理。
湿实验同样不能替代权限控制。一个分子设计可以在实验上成立,同时来自越权访问或危险用途。第三道门验证物理主张,不负责发放许可。
用一条证据记录连接三道门
现实组织往往把三道门放在不同系统里:ML 团队管理评测,安全与合规团队管理授权,实验室管理样本和测量。系统之间的断点会成为新的风险面。
每个高影响运行至少需要共享以下字段:
| 字段 | 能力门 | 访问门 | 湿实验门 |
|---|---|---|---|
| 验证对象 | 模型、代码提交、benchmark case | 用户、机构、项目、授权 | 设计、样本、protocol、assay |
| 通过条件 | 可复现、速度和质量阈值 | 资质、范围、控制与有效期 | 预先声明的实验终点 |
| 证据 | 日志、hash、输出、置信区间 | 审批记录、策略版本、监测事件 | 原始测量、对照、成功和失败结果 |
| 责任人 | 模型与平台团队 | 机构管理员与模型提供方 | 实验室与科学审阅者 |
| 重新验证触发器 | 模型、硬件或依赖变化 | 时间、范围、人员或风险变化 | 新目标、新 protocol 或材料变化 |
| 失败动作 | 回滚模式或收窄结论 | 暂停、调查或重设范围 | 拒绝候选,并把结果反馈给评测系统 |
三张表之间还要有稳定关联。实验测量应当能回溯到确切设计、模型版本、工具链、工作流、授权范围和审阅者。模型更新后,系统应当知道哪些 benchmark 和 assay 需要重跑。授权变化后,系统也应当知道哪些 Agent 和项目会受到影响。
这与此前讨论的科学 Agent 验证栈属于同一种治理结构。生命科学多出两项强约束:物理实验反馈和双重用途权限。只有把通用的企业 AI 治理绑定到这些具体对象,治理才会变成可执行系统。
一套可以直接使用的发布口径
三道门可以转化为四条写作和决策规则:
- 代码和冻结评测证明性能增益时,使用计算性能已改善。
- 身份、机构、用途、安全措施和有效期都记录后,使用已授权用于指定范围。
- 具体物理主张通过预先声明且带对照的 assay 后,使用已经实验验证。
- 结果跨越新目标、独立团队或条件变化后,才使用具备泛化能力。
按照这套口径,Anthropic 的模型优化已经具备详细的同机构 benchmark 和公开工件;LSVP 有清晰的访问设计,但 beta 项目的公开运行历史仍很短;蛋白竞赛提供了通往湿实验的路径,实验结果仍在未来。
分开陈述这些状态不会削弱成果。它让读者准确知道什么已经被演示,什么已经被授权,什么还需要真实生物系统给出答案。
常见问题
AI 蛋白设计为什么必须做湿实验?
计算指标只能估计模型和训练数据已经表示的性质。湿实验需要验证分子能否表达、折叠、结合、保持稳定并在真实条件下达到预期效果。两类证据回答不同问题。
Anthropic 已经对这批 Claude 设计做湿实验了吗?
没有。技术报告明确说明,新效率实验产生的 binder 设计尚未进行实验测试。另一个蛋白设计竞赛计划测试 5000 多个入选设计。
Exact 模式证明了什么?
Exact 的目标是在确定性设置下逐 bit 重现未修改模型的输出。它可以支持测试范围内的软件等价性结论,无法证明上游生物模型本身正确。
LSVP 的 Standard Use 和 High-risk Use 有什么区别?
Standard Use 是面向团队、每年续期的广泛生命科学权限。High-risk Use 是绑定具体项目、每六个月续期的附加权限。其他安全措施仍然保留,Mythos 的高风险权限在上线时限制更严格。
完成机构资质审核后,还需要实时安全控制吗?
需要。身份和用途审核增强责任归属,离线监测适合识别跨会话模式,但账号安全、内部人员风险、事件响应和生命科学之外的技术护栏仍然不可缺少。
参考资料
- Anthropic:How Claude is uplifting biomolecular modeling,2026 年 9 月 17 日。
- Anthropic 等:Accelerating open-source biomolecular models with Claude,2026 年 9 月 17 日。
- Anthropic:uplifting-biomolecular-modeling 开源仓库,2026。
- Anthropic:Introducing the Life Sciences Verification Program,2026 年 9 月 17 日。
- Proteinbase:Anthropic 与 Adaptyv 蛋白设计竞赛,核验于 2026 年 9 月 18 日。
- Twist Bioscience:AI's Future Hinges On The Wet Lab,2025 年 10 月 16 日。
- Xu 等:Benchmarking all-atom biomolecular structure prediction with FoldBench,Nature Communications,2025。
- Overath 等:Predicting Experimental Success in De Novo Binder Design 分析代码与数据,2025。