Administrator
Published on 2026-10-04 / 9 Visits
0
0

AI 研究 Agent 选对赢家,也可能不懂系统

AI 研究 Agent 找到最佳配置,只能证明这次搜索有用。它是否理解每个组件在不同背景下的作用,仍然需要另一组测试。WhatWorkedBench 的核心价值,是把找到赢家和理解系统拆成两个可独立验收的目标。

阅读时间:约 7 分钟 · 字数:约 2600 字

TL;DR

  • WhatWorkedBench 要求 Agent 在有限实验预算下提交完整配置响应面,而非只报告最佳结果。
  • 在 22 个四因子来源、8 次付费测量的设置中,pair-effect ridge 选中最优配置 15 次,严格重建只通过 3 次。
  • 其中 13 个来源同时出现选中最优和条件效应误差超过真实效用范围 10% 的情况。
  • 研究 Agent 应分别验收探索质量与系统重建质量,避免把局部成功写成全局理解。
  • 代码约束只有进入估计器或最终工件校验,才会从推理线索变成系统保证。

找到赢家,是一种很弱的理解证明

假设 Agent 测试了十套训练配置,最后挑出效果最好的一套。这个结果当然有价值,但它没有回答另一个问题:Agent 真正理解了哪些变量起作用,还是只在有限搜索中踩中了高点?

只要团队准备迁移经验,差别就会显现。某个组件在一套背景中提升指标,换一组组件后可能反而降低指标。只保留赢家,团队无法预测下一个改动,也无法判断原结论何时失效。

WhatWorkedBench 把这个认知缺口变成了可执行评测。Agent 可以查看工作流代码,获得两个免费锚点,在预算内购买若干实验结果,最后必须预测所有合法配置的分数。评估器用穷举的原生 CPU 运行结果作为隐藏真值。

它问的不是 Agent 能否打败基线,而是 Agent 从自己选择的实验中到底学到了什么。

基准如何测量实验理解

公开版本覆盖 36 个任务条件、30 个数据源、8 类工作流和 1,248 条索引配置记录,工作流包括分类、回归、聚类、预测、图像恢复、检索、节拍检测和图链接预测。仓库还保存了 4,206 次数值控制运行,并提供原生 replay、测试和审计脚本。

四因子任务一共有 16 种配置,六因子任务有 64 种。每轮任务提供全关闭和全开启两个免费测量,Agent 再使用预算购买其他结果,最终交付完整预测表。

评测同时观察五类能力:

验收目标 实际问题
最优配置与 selection regret Agent 最后选得好不好
条件效应误差 一个组件在不同背景下切换时,影响是否预测正确
两两交互误差 两个变化之间是否存在依赖
完整网格误差 未观测配置的响应面能否还原
工件交付 最终表是否完整、合法、可评分

条件效应是这里最重要的设计。它固定其他选项,只切换一个组件,从而暴露平均值会掩盖的反转。论文在大量任务中观察到同一个开关在不同背景下正负效应相反。一个平均组件分数无法表达这种结构。

核心结果:优化成功与系统理解会分离

在 22 个四因子来源、8 次付费测量的设置中,pair-effect design 加 ridge 重建取得 0.612 的 family-macro effect recovery,并在 15 个来源上选中精确最优配置。

如果只看赢家,这是一份相当好的成绩单。加入严格重建后,只有 3 个来源通过。严格重建要求每一项条件效应误差都不超过真实效用范围的 10%。有 13 个来源同时满足两件事:Agent 选中了最优配置,但至少一项条件效应误差超过阈值。

这组数字支持一个明确结论:找到赢家和重建系统是互补指标,二者不能互相替代。

effect-variance Gaussian process 的结果进一步说明,单一排名很容易误导。它在同一预算下达到 0.701 的 recovery,精确选中最优 16 次,但严格重建只通过 1 次。平均恢复率更高、赢家更多、全效应通过更少,可以同时发生,因为三个指标观察的是不同失效形态。

工程上合理的动作,是保留多维验收,而不是寻找一个总分覆盖所有问题。

把采样策略与推断方法拆开

研究 Agent 至少做了两类决策:

  1. 预算应该买哪些实验结果。
  2. 如何从已测结果推断未测配置。

端到端分数会把两者混在一起。WhatWorkedBench 还会在同一组观测上拟合共享估计器,用来判断 Agent 买到的证据是否有信息量,以及它选择的重建方法是否充分利用了证据。

12 个来源的前瞻 typed study 没有给出一个简单的模型排名。Flash 交付 12/12 个完整表,相比使用同一批观测的 GP,平均 recovery 高 0.147。Pro 交付 11/12 个表;按全部尝试计分时差异为 -0.001,只看成功交付的 11 个表时则为 +0.063。

这说明交付必须进入验收合同。一份没有成功提交的优秀预测,对真实系统没有业务价值。它也说明单一总分会丢失关键信息:采样质量、推断质量和工件完整性可以各自变化。

代码结构是证据,进入校验后才是保证

有些配置从代码结构上就等价。例如父功能关闭时,某个子参数不再生效。Agent 读取代码后可以发现这种关系,减少重复测量。

发现规则仍然只是第一步。论文的一组诊断中,Agent 报告出了全部注册关系,最后生成的 ridge-helper 表却仍然违反原生等价关系。事后执行等价类一致性投影后,recovery 从 0.338 提升到 0.507。

在固定观测实验中,新 Agent 把六条规则全部传入具名估计器,96 对等价配置全部一致。同一批观测上,规则约束让 D2 recovery 从 0.319 提升到 0.601,让 GP recovery 从 0.509 提升到 0.666。

这里有一条可迁移的工程原则:推理轨迹里的规则只是已识别内容;进入估计器、验证器或最终工件 schema 后,规则才成为可复算的系统属性。

为研究 Agent 建立两张成绩单

团队可以借用这种分离方法,不必完整复制基准。

第一张成绩单验收探索价值:

  • 已观测或最终选择的最佳效用;
  • 有参考真值时的 selection regret;
  • 实验成本、耗时和失败次数;
  • 配置覆盖与采样多样性。

它回答本轮搜索是否找到有用候选。

第二张成绩单验收重建质量:

  • 未观测配置的预测误差;
  • 不同背景下的条件效应误差;
  • 组件交互误差;
  • 保留区域上的不确定性校准;
  • 与代码约束或领域约束的一致性。

它回答本轮实验是否产生了可以迁移的知识。

报告时也应保留这一区分。找到最佳配置可以被标记为搜索成功,只有完成独立重建验收后,才能进一步声称 Agent 形成了系统理解。证据标签由验收结果决定,而不是由叙事强度决定。

一套最小可执行协议

内部研究 Agent 可以从六步开始:

  1. 冻结任务。 固定代码、数据划分、随机种子策略、指标和合法干预集合。
  2. 保留参考集。 留出若干配置或干预对,不向 Agent 暴露结果。
  3. 限制测量预算。 记录每次查询,包括失败请求和重复请求。
  4. 要求完整工件。 提交预测表或预测函数,避免只交付赢家名称。
  5. 执行确定性约束。 在模型外校验等价类、失活参数、数值范围和 schema。
  6. 分别报告两张成绩单。 同时给出搜索结果、保留集重建、交付状态和证据边界。

WhatWorkedBench 仓库 用可信评估进程、公开 Agent 输入、隐藏参考、可复现原生运行和机器可读审计实现了这条边界。具体指标针对固定二元组件设计,但信任边界具有普遍价值。

证据支持到哪里

这个基准使用确定性 CPU 工作流、二元组件开关和可穷举的小配置空间,因此能够构造严格参考面。开放式科研还会遇到假设变化、测量噪声、目标模糊和无法穷举的干预。

论文没有证明响应面测试足以代表科学理解。它证明了一个更窄、也更实用的事实:即使在受控环境中,找对最佳配置也无法认证广泛的实验理解。

这已经足以改变当前研究 Agent 的验收方式。

常见问题

什么是研究 Agent 的实验理解?

在这个基准中,它指 Agent 用有限实验预测组件变化如何影响工作流的能力。评测对象是完整响应面和条件效应,而不是只看最终赢家。

为什么最优配置不能证明理解?

多套局部错误的模型可能把同一个配置排在第一名,却在其他配置和组件交互上产生完全不同的预测。

无法穷举时如何测试理解?

保留一组隐藏配置或干预对,让 Agent 在揭晓结果前提交预测,再分别计算结果误差与条件效应误差。代码和领域约束可以作为额外的确定性检查。

GP 是否总比 Agent 更可靠?

论文没有得到这个结论。部分队列中 Agent 的直接预测表优于同观测 GP,另一些条件下共享估计器改善了结果。重点是固定观测后的受控比较。

这套方法能否用于真实科研?

预算日志、保留干预、完整工件、约束校验,以及探索与重建分离计分都可以迁移。完整穷举响应面通常无法迁移。

参考资料

下一步:在现有研究 Agent 评测中,把一组未观测配置的重建分数放到最佳结果旁边。两者之间的差距,就是能力边界开始变清晰的位置。


Comment