Administrator
Published on 2026-09-18 / 14 Visits
0
0

Anthropic 生命科学 AI 新实践:能力、访问与湿实验三道门

生命科学 AI 容易出现三种概念混用:模型在 benchmark 上变强,被理解成可以开放更多权限;研究机构通过资质审核,被理解成输出值得信任;一批分子进入湿实验,被理解成计算设计已经得到验证。

这三件事分别回答三个问题:系统能做什么,谁可以在什么范围内使用,输出能否在物理世界成立。它们需要三道独立门禁,也需要一条共同证据链。

Anthropic 在 2026 年 9 月 17 日发布的三组材料,刚好把这套结构摊开了:Claude 优化了 30 多个开源生物分子模型;Life Sciences Verification Program 开始按机构、用途和风险授予更宽松的模型访问;Anthropic 与 Adaptyv 计划为 5000 多个蛋白设计做湿实验。真正值得研究的不是某个数字,而是三种验证之间的边界。

先确认三件已经发生或尚未发生的事

第一件事是计算工具优化。Anthropic 的技术报告覆盖 36 个实现,对应 30 多个结构预测、蛋白设计、基因组和蛋白语言模型。Claude 在两名具备生物分子建模经验的 Anthropic 研究人员监督下,用不到四周完成这些优化。

报告给出的核心口径包括:

  • Exact 模式在 14 个结构预测模型上平均把 forward pass 加速 1.6 倍,目标是在确定性设置下保持逐 bit 一致。
  • Fast 模式覆盖 13 个模型,平均加速 4.1 倍,允许小幅数值差异。
  • 在 1925 个模型与目标组合中,默认、Exact、Fast、Big 四种配置得到可接受界面的比例分别是 54.8%、55.0%、54.5% 和 54.2%。三种优化模式与默认配置的总体差异都没有排除零的 95% 置信区间,但报告明确承认,小幅精度损失仍不能排除。
  • Big 模式在单个 8 GPU 节点上准确预测了若干超过 10000 token 的系统,也完成了最高 70320 个残基的推理。后者的结构全部塌缩,结果并不准确。

第二件事是访问治理。Anthropic 的 Life Sciences Verification Program 会检查申请方的研究资质、安全标准和伦理监督,再授予 Standard Use 或 High-risk Use。

Standard Use 面向团队的日常生命科学工作,每年续期。High-risk Use 是绑定具体项目的附加权限,每六个月续期,可以解除生命科学请求上的阻断,但网络安全等其他分类器仍然保留。项目上线时,Opus 5 和 Sonnet 5 已可申请高风险权限;Mythos 的高风险权限仍只向经过额外审查的少量实体开放。

第三件事是湿实验计划。Anthropic 与 Adaptyv 蛋白设计竞赛计划合成和测试 5000 多个入选设计,并公开成功和失败结果。这里的时态很重要。Anthropic 当前报告中的新一批 binder 结果仍是 in silico 评分,报告明确写明尚未进行实验测试。竞赛建立了第三道门,但门后的数据还没有产生。三道门是本文从三组材料归纳出的分析框架,Anthropic 没有把它作为正式标准发布。

第一扇门:能力证据验证系统是否完成了声明任务

能力验证需要冻结评测合同。模型版本、上游代码、硬件、输入规模、batch、计时范围、精度指标、随机种子和对照配置都应该写清楚。否则,四倍加速只是一个无法复算的营销数字。

这次材料的价值在于报告和开源仓库都提供了较细的验证接口。仓库按模型保留基线版本、环境、变更记录、测试和不同优化模式。审阅者可以检查某个具体模型的修改,而不必整体接受 Claude 优化 30 多个模型这个大命题。

报告也保留了足够多的失败信息:

  • 性能与显存结果主要来自固定版本和 NVIDIA H100,换硬件、输入和上游版本后可能变化。
  • ColabFold 的对照版本是 1.6.1,没有纳入同期新增的可选融合 kernel。
  • Exact 与 Fast 的显存占用最高可能达到默认配置的 3.2 倍。速度更快和更容易部署属于两件事。
  • 部分上游模型在生产设置下本身就无法逐次复现。
  • 基因组与蛋白语言模型主要检查优化输出是否接近默认输出,没有测量下游生物学有效性。
  • Big 模式可以扩大可计算范围,却无法让模型自动获得训练分布之外的泛化能力。

公开工件仍没有跨过独立复现这一层。优化、benchmark、数据分析和报告发布主要由 Anthropic 完成。仓库定位是 reference release,不是持续维护项目;多数模型权重需要按上游许可证另行获取。技术报告公开了代码,却没有放出全部派生 benchmark 数据、运行日志和 headline binder 设计集。

最后一条尤其关键。推理成功、指标持平和生物学成立是三个层级。70320 个残基的任务成功跑完,只证明系统跨过了计算门槛;预测结构塌缩说明它没有跨过模型能力门槛。

第二扇门:访问验证决定谁能在什么范围内使用

能力 benchmark 无法回答权限问题。访问验证需要绑定身份、机构、用途、风险等级和有效期。

LSVP 有几个值得借鉴的设计:

  1. 日常团队权限与例外项目权限分开。
  2. 每份授权绑定申请时声明的用途。
  3. 高风险权限缩短续期周期。
  4. 流量持续与声明用途进行比对。
  5. 机构管理员负责在约定时限内分诊和处置异常。

代价同样明确。为了识别跨请求、跨会话的行为模式,LSVP 将部分控制从实时阻断改为离线监测,并要求相关流量保留 30 天。Anthropic 表示,这些数据会隔离存放,不用于模型训练,也不会向生命科学研究团队开放。

这套机制提供的是责任和异常检测,并不消除风险。Anthropic 把账号接管、内部人员滥用和 Agent 误用列为三类主要威胁。合格机构的账号仍可能被盗,合格员工仍可能越权,长任务 Agent 仍可能偏离预期。授权记录必须能回答谁应当处理异常、按什么范围判断越界、何时暂停权限。

上线边界也需要单独记录。当前 LSVP 是团队和机构 beta,不支持第三方平台,也不适用于启用 BAA 的组织。Anthropic 明确要求处理受保护健康信息的客户使用独立的非 BAA 组织,并且只放入非 HIPAA 数据。这属于硬数据边界,不能藏在采购说明里。

第三扇门:湿实验验证计算结论能否进入物理世界

计算分数用于筛选候选,无法合成蛋白,也无法测量真实结合、稳定性、毒性和可制造性。湿实验之所以是独立门禁,是因为真实生物系统包含模型和评分函数没有表示的失效模式。

竞赛方案里有几项重要约束:

  • 入选设计不会只看单一 in silico 指标。
  • 提交前必须由研究人员审阅。
  • 只有一部分设计会进入实验,参赛本身不代表获得验证。
  • 被测试设计将公开序列、预测结构、设计方法、实验测量和负结果。
  • 提交、实验和结果发布是三个分开的阶段。

负结果公开决定了这批数据能否成为真正的反馈闭环。如果榜单只展示成功 binder,外部研究者无法估计设计流程的假阳性率。把计算分数和失败实验放在一起,才能识别哪些目标类型容易失效,哪些排序指标存在系统偏差,以及下一版模型是否提高了真实命中率。

选择过程本身也是证据的一部分。竞赛只测试入选设计,并计划用 Claude-based workflow 参与选择。选择规则、总提交量、目标分层和失败定义公开之前,这批被测试样本还不能无偏估计整条设计管线的命中率。

独立研究能够支持三道门的必要性,但没有复现 Anthropic 的新结果。已经发表的 FoldBench benchmark显示,结构预测性能会随任务类型和数据相似度明显变化。另一项覆盖 3766 个实验 binder 的元分析表明,ipSAE 等计算指标适合作为排序信号,但它们仍是随 target 变化的湿实验成功率代理。

湿实验同样不能替代权限控制。一个分子设计可以在实验上成立,同时来自越权访问或危险用途。第三道门验证物理主张,不负责发放许可。

用一条证据记录连接三道门

现实组织往往把三道门放在不同系统里:ML 团队管理评测,安全与合规团队管理授权,实验室管理样本和测量。系统之间的断点会成为新的风险面。

每个高影响运行至少需要共享以下字段:

字段 能力门 访问门 湿实验门
验证对象 模型、代码提交、benchmark case 用户、机构、项目、授权 设计、样本、protocol、assay
通过条件 可复现、速度和质量阈值 资质、范围、控制与有效期 预先声明的实验终点
证据 日志、hash、输出、置信区间 审批记录、策略版本、监测事件 原始测量、对照、成功和失败结果
责任人 模型与平台团队 机构管理员与模型提供方 实验室与科学审阅者
重新验证触发器 模型、硬件或依赖变化 时间、范围、人员或风险变化 新目标、新 protocol 或材料变化
失败动作 回滚模式或收窄结论 暂停、调查或重设范围 拒绝候选,并把结果反馈给评测系统

三张表之间还要有稳定关联。实验测量应当能回溯到确切设计、模型版本、工具链、工作流、授权范围和审阅者。模型更新后,系统应当知道哪些 benchmark 和 assay 需要重跑。授权变化后,系统也应当知道哪些 Agent 和项目会受到影响。

这与此前讨论的科学 Agent 验证栈属于同一种治理结构。生命科学多出两项强约束:物理实验反馈和双重用途权限。只有把通用的企业 AI 治理绑定到这些具体对象,治理才会变成可执行系统。

一套可以直接使用的发布口径

三道门可以转化为四条写作和决策规则:

  • 代码和冻结评测证明性能增益时,使用计算性能已改善。
  • 身份、机构、用途、安全措施和有效期都记录后,使用已授权用于指定范围。
  • 具体物理主张通过预先声明且带对照的 assay 后,使用已经实验验证。
  • 结果跨越新目标、独立团队或条件变化后,才使用具备泛化能力。

按照这套口径,Anthropic 的模型优化已经具备详细的同机构 benchmark 和公开工件;LSVP 有清晰的访问设计,但 beta 项目的公开运行历史仍很短;蛋白竞赛提供了通往湿实验的路径,实验结果仍在未来。

分开陈述这些状态不会削弱成果。它让读者准确知道什么已经被演示,什么已经被授权,什么还需要真实生物系统给出答案。

常见问题

AI 蛋白设计为什么必须做湿实验?

计算指标只能估计模型和训练数据已经表示的性质。湿实验需要验证分子能否表达、折叠、结合、保持稳定并在真实条件下达到预期效果。两类证据回答不同问题。

Anthropic 已经对这批 Claude 设计做湿实验了吗?

没有。技术报告明确说明,新效率实验产生的 binder 设计尚未进行实验测试。另一个蛋白设计竞赛计划测试 5000 多个入选设计。

Exact 模式证明了什么?

Exact 的目标是在确定性设置下逐 bit 重现未修改模型的输出。它可以支持测试范围内的软件等价性结论,无法证明上游生物模型本身正确。

LSVP 的 Standard Use 和 High-risk Use 有什么区别?

Standard Use 是面向团队、每年续期的广泛生命科学权限。High-risk Use 是绑定具体项目、每六个月续期的附加权限。其他安全措施仍然保留,Mythos 的高风险权限在上线时限制更严格。

完成机构资质审核后,还需要实时安全控制吗?

需要。身份和用途审核增强责任归属,离线监测适合识别跨会话模式,但账号安全、内部人员风险、事件响应和生命科学之外的技术护栏仍然不可缺少。

参考资料


Comment