Administrator
Published on 2026-10-10 / 3 Visits
0
0

ThinkingBox 评测审计:20 次运行如何拆开 Agent 能力与可靠性

ThinkingBox 把 507 个有状态业务任务各运行 20 次,并用数据库终态判定 Agent 是否真正完成工作。它揭示的关键问题很直接:偶尔找到一条成功路径和稳定交付,是两种能力。与此同时,样本中的 20 次全胜只是一条强信号,还不足以写成生产 SLA。理解这项研究,需要先拆开四种指标,再核对公开资产究竟支持哪些结论。

它评测的是业务终态

ThinkingBox 是运行框架,负责组织 LLM Agent、模拟用户和隔离的 MCP 工具会话。ThinkingBox-Bench v1.0 是冻结的评测集,包含五类业务:

业务域 任务数
零售与电商 98
旅行与酒店 104
车险 100
新银行内部 IT 支持 104
咨询公司的 IT 与 HR 支持 101
合计 507

我核对了冻结标签中的权威清单,确有 507 项。这里的 507 指可执行任务实例,更准确的说法是 507 个 workflow instances,而非 507 种完全不同的工作流模板。

每项任务都包含初始数据库状态、用户目标、领域政策、可用工具、模拟用户掌握的私有信息和隐藏检查。每次运行先恢复相同初态,再创建独立会话。对话结束后,评测器检查数据库终态和副作用。错字段、漏改、额外记录或越界修改都会导致失败。

507 项全部检查后端状态,其中 30 项还用二元 rubric 检查最终回复里的披露、保密和一致性要求。其余 477 项以确定性的状态检查为主。这个设计回答的是 Agent 是否把系统带到了目标状态,而非客服表达是否全面、准确和令人满意。

同一个 20 次实验里有四种答案

围绕 ThinkingBox 的二手解读经常把 pass^20 和 20/20 混在一起。以 2026 年 10 月 1 日发布的论文 v4为准,至少要区分四个口径:

指标 回答的问题 计算方式
pass@1 随机跑一次,通常能否成功 507 项各 20 次,共 10140 个结果的微平均
pass@20 给 20 次机会,能否至少找到一次成功路径 每项是否出现过成功
plug-in pass^20 根据每项的观测成功率估算重复 20 次全胜概率 先算每项 (成功次数/20)^20,再跨任务平均
observed 20/20 这批实验中,哪些任务实际 20 次全胜 20 次成功的任务数除以 507

GPT-5.4 的结果能看出差别:

  • pass@1 为 65.36%
  • pass@20 为 91.12%,即 462 项至少成功过一次
  • 论文 v4 的 plug-in pass^20 为 30.62%
  • 实际 20/20 为 128 项,占 25.25%

早期 Microsoft 页面曾把 25.25% 写成 pass^20。论文 v4 已把 plug-in 估计和字面 20/20 数量分开。引用这个基准时,资料版本和指标定义必须一起写。

另一个常见算法同样会误导:直接把总体 pass@1 做 20 次方。0.6536^20 约为 0.020%,与论文的 30.62% 相差巨大。原因在于任务难度高度分化。有些任务接近必胜,有些任务几乎无法完成。先求平均会抹掉这种分布结构。

通用的配置冻结、grader 有效性、重复试验与部署证据框架,可参照站内的完整 AI Agent 评测框架。ThinkingBox 的价值在于提供了一组具体实证,而非替代整个评测方法论。

一次能力排名和重复可靠性排名会分叉

论文 v4 的四个代表模型如下:

模型 pass@1 pass@20 plug-in pass^20 实际 20/20 任务数
Claude Opus 5 66.50% 79.09% 47.53% 241
GPT-5.4 65.36% 91.12% 30.62% 128
GPT-6 Astra 58.31% 71.01% 46.89% 231
Kimi-K3 57.37% 93.89% 17.60% 68

Kimi-K3 覆盖的任务最广,476 项至少成功过一次;实际连续 20 次全胜的任务只有 68 项。GPT-6 Astra 的 pass@1 在论文中排第五,pass^20 却排第二。若产品允许多次尝试并从中取一次成功,选择逻辑偏向 breadth;若相同业务需要稳定重复执行,选择逻辑会换一套排序。

Hugging Face 与 Microsoft 的 10 月 3 日联合文章又补充了 Claude Opus 5.5:pass@1 为 67.16%,实际 20/20 仍为 241 项。这个模型没有进入 10 月 1 日论文 v4 的主表,适合标注为论文后的官方追加结果。

Agent 说完成了,数据库可能不同意

ThinkingBox 最有价值的证据来自弱判分器与终态判分的对照。

在 12 个模型的共同子集中,121680 条有效轨迹里有 79853 条未通过终态检查。失败轨迹中,67.24% 已经正常结束,执行过写操作,而且最后一次工具响应没有显式报错。只看对话结束标记、写工具调用和最后一个工具返回,会把这些失败误判成完成。

终态检查进一步发现:

  • 77.61% 有错误字段值
  • 43.30% 产生额外副作用
  • 25.36% 缺少必要状态或副作用

三类可以重叠。论文还用固定优先级为失败轨迹分配可复现标签,非加权平均结果为工具使用与恢复问题 79.9%、错误状态更新 10.3%、用户问题未闭环 7.0%、没有状态变更 2.9%。这些标签描述可观察现象,不能直接等价为唯一根因。

这组数据把证据层级说得很清楚:Agent 的总结反映它对完成状态的判断;工具调用说明流程有动作;持久化终态才决定业务是否完成。

20 次全胜仍然是一组有限样本

20/20 适合当筛选门槛,也适合暴露单次分数隐藏的波动。它表达的是当前 20 次运行里没有观察到失败。

在简化的独立伯努利模型下,20 次零失败对应的单侧 95% 成功率下界约为 0.05^(1/20)=86.1%。即便样本全胜,底层成功率仍存在不小的不确定区间。生产环境还会遇到相关故障,例如同一供应商中断、共享限流、凭据过期、数据库迁移和并发污染,独立模型的统计边界会进一步收紧。

ThinkingBox 每次都回到相同干净初态。它有效隔离了前一次运行留下的状态,却没有模拟连续二十个真实订单、理赔或权限请求在生产系统里累积影响。因此,这项基准测的是冻结条件下的重复执行可靠性,覆盖不到跨任务长期状态、事故恢复和流量相关失效。

论文还明确列出几项限制:

  • 任务来自非公开案例的合成重建,不代表企业工作的总体分布
  • 每项只保留一个黄金终态,多种合理解决方案的工作流会被过滤
  • 模拟用户目标固定、保持配合,最多进行十轮追问
  • 477 项可以在后端更新正确、用户说明错误时仍然通过
  • 30 项回复 rubric 与模拟用户都使用 GPT-5.4-mini,公开材料没有提供 rubric 的独立人工校准

因此,合适的结论是 ThinkingBox 在明确的 Harness 下测量了一组可执行业务任务的重复完成度。它提供生产决策证据,还需要本地任务、真实流量和风险门禁继续补强。

能重跑框架,不等于能复核历史榜单

ThinkingBox 的公开程度高于许多 Agent 基准。官方发布了运行框架、任务定义、MCP servers、冻结清单、数据浏览视图、聚合源码和生成逐试次 JSONL 的命令。公开源码也能确认 pass^k 的 plug-in 计算方式。

截至 2026 年 10 月 10 日,公开资产中没有发现论文全部模型实验的完整历史 JSONL。论文附录给出少量代表性完整轨迹,仓库没有提供 18 个模型全部对话、工具结果、Token 记录和逐试次 verdict 的下载包。

外部团队可以复跑一轮新的实验,却无法只依赖作者的公开历史轨迹,重新计算论文中的全部任务成功次数、bootstrap 区间、失败分类和批次相关性。闭源模型持续更新,也会让历史数字越来越难精确复现。

这属于两种不同的证据状态:框架和任务可执行,说明实验能够重新实施;历史轨迹缺失,意味着既有榜单还没有达到逐试次独立复核。类似的边界也适用于程序修复数据集,详见公开检查与独立评测的边界。

把 20 次实验迁移成生产可靠性合同

ThinkingBox 更适合作为设计样板,而非统一要求所有团队照搬二十次。

  1. 冻结代表性任务、初态、政策、工具、grader、模型路由和预算。
  2. 分开记录终态正确性、缺失副作用、额外副作用、权限约束和回复忠实度。
  3. 同时报 pass@1、允许重试后的恢复率、任务级一致性、延迟、成本和人工接管。
  4. 保存逐试次原始记录,让聚合指标可重算,失败过程可追踪。
  5. 专门测试供应商中断、共享限流、旧凭据、schema 变化和并发等相关故障。
  6. 按失败代价确定重复次数和门槛。高风险写操作需要更强证据,低风险查询可以用较轻门禁。
  7. 离线通过后进入 shadow,再用 canary 核验真实终态、人工接管和回滚信号。

需要落地步骤的团队,可以直接参考把产品终态变成动态发布门禁。

ThinkingBox 给出的核心提醒很克制:一次成功证明 Agent 有能力做成;重复成功只能在指定任务、指定系统配置和指定时间窗口内逐步赢得信任。可靠性是一份可执行的验收合同,而非模型名称自带的属性。

常见问题

ThinkingBox 和 ThinkingBox-Bench 有什么区别?

ThinkingBox 是可复用运行框架。ThinkingBox-Bench 是冻结的 507 项业务任务、工具服务器、政策和检查集合。

Stateful 指长期记忆吗?

这里主要指任务中的工具会改变持久化业务状态,评测器随后检查数据库和副作用。它没有证明 Agent 能长期管理跨任务记忆。

20 次全胜能证明 100% 可靠吗?

它证明该任务在当前配置的 20 次样本中没有失败。未来成功率仍有统计不确定性,生产条件还会引入相关故障。

为什么工具调用成功,任务仍会失败?

调用可能改错对象或字段,也可能漏掉必要后续动作、产生额外副作用,或在前置条件失败后没有恢复。API 成功与业务完成属于不同证据层级。

ThinkingBox 首次提出终态判分和 pass^k 吗?

更早的 tau-bench已经采用终态数据库判分和重复成功指标。ThinkingBox 的增量在于 MCP 兼容运行时、五业务域、明确副作用检查、冻结发布和大规模重复实验的组合。

参考资料


Comment