ThinkingBox 把 507 个有状态业务任务各运行 20 次,并用数据库终态判定 Agent 是否真正完成工作。它揭示的关键问题很直接:偶尔找到一条成功路径和稳定交付,是两种能力。与此同时,样本中的 20 次全胜只是一条强信号,还不足以写成生产 SLA。理解这项研究,需要先拆开四种指标,再核对公开资产究竟支持哪些结论。
它评测的是业务终态
ThinkingBox 是运行框架,负责组织 LLM Agent、模拟用户和隔离的 MCP 工具会话。ThinkingBox-Bench v1.0 是冻结的评测集,包含五类业务:
| 业务域 | 任务数 |
|---|---|
| 零售与电商 | 98 |
| 旅行与酒店 | 104 |
| 车险 | 100 |
| 新银行内部 IT 支持 | 104 |
| 咨询公司的 IT 与 HR 支持 | 101 |
| 合计 | 507 |
我核对了冻结标签中的权威清单,确有 507 项。这里的 507 指可执行任务实例,更准确的说法是 507 个 workflow instances,而非 507 种完全不同的工作流模板。
每项任务都包含初始数据库状态、用户目标、领域政策、可用工具、模拟用户掌握的私有信息和隐藏检查。每次运行先恢复相同初态,再创建独立会话。对话结束后,评测器检查数据库终态和副作用。错字段、漏改、额外记录或越界修改都会导致失败。
507 项全部检查后端状态,其中 30 项还用二元 rubric 检查最终回复里的披露、保密和一致性要求。其余 477 项以确定性的状态检查为主。这个设计回答的是 Agent 是否把系统带到了目标状态,而非客服表达是否全面、准确和令人满意。
同一个 20 次实验里有四种答案
围绕 ThinkingBox 的二手解读经常把 pass^20 和 20/20 混在一起。以 2026 年 10 月 1 日发布的论文 v4为准,至少要区分四个口径:
| 指标 | 回答的问题 | 计算方式 |
|---|---|---|
| pass@1 | 随机跑一次,通常能否成功 | 507 项各 20 次,共 10140 个结果的微平均 |
| pass@20 | 给 20 次机会,能否至少找到一次成功路径 | 每项是否出现过成功 |
| plug-in pass^20 | 根据每项的观测成功率估算重复 20 次全胜概率 | 先算每项 (成功次数/20)^20,再跨任务平均 |
| observed 20/20 | 这批实验中,哪些任务实际 20 次全胜 | 20 次成功的任务数除以 507 |
GPT-5.4 的结果能看出差别:
- pass@1 为 65.36%
- pass@20 为 91.12%,即 462 项至少成功过一次
- 论文 v4 的 plug-in pass^20 为 30.62%
- 实际 20/20 为 128 项,占 25.25%
早期 Microsoft 页面曾把 25.25% 写成 pass^20。论文 v4 已把 plug-in 估计和字面 20/20 数量分开。引用这个基准时,资料版本和指标定义必须一起写。
另一个常见算法同样会误导:直接把总体 pass@1 做 20 次方。0.6536^20 约为 0.020%,与论文的 30.62% 相差巨大。原因在于任务难度高度分化。有些任务接近必胜,有些任务几乎无法完成。先求平均会抹掉这种分布结构。
通用的配置冻结、grader 有效性、重复试验与部署证据框架,可参照站内的完整 AI Agent 评测框架。ThinkingBox 的价值在于提供了一组具体实证,而非替代整个评测方法论。
一次能力排名和重复可靠性排名会分叉
论文 v4 的四个代表模型如下:
| 模型 | pass@1 | pass@20 | plug-in pass^20 | 实际 20/20 任务数 |
|---|---|---|---|---|
| Claude Opus 5 | 66.50% | 79.09% | 47.53% | 241 |
| GPT-5.4 | 65.36% | 91.12% | 30.62% | 128 |
| GPT-6 Astra | 58.31% | 71.01% | 46.89% | 231 |
| Kimi-K3 | 57.37% | 93.89% | 17.60% | 68 |
Kimi-K3 覆盖的任务最广,476 项至少成功过一次;实际连续 20 次全胜的任务只有 68 项。GPT-6 Astra 的 pass@1 在论文中排第五,pass^20 却排第二。若产品允许多次尝试并从中取一次成功,选择逻辑偏向 breadth;若相同业务需要稳定重复执行,选择逻辑会换一套排序。
Hugging Face 与 Microsoft 的 10 月 3 日联合文章又补充了 Claude Opus 5.5:pass@1 为 67.16%,实际 20/20 仍为 241 项。这个模型没有进入 10 月 1 日论文 v4 的主表,适合标注为论文后的官方追加结果。
Agent 说完成了,数据库可能不同意
ThinkingBox 最有价值的证据来自弱判分器与终态判分的对照。
在 12 个模型的共同子集中,121680 条有效轨迹里有 79853 条未通过终态检查。失败轨迹中,67.24% 已经正常结束,执行过写操作,而且最后一次工具响应没有显式报错。只看对话结束标记、写工具调用和最后一个工具返回,会把这些失败误判成完成。
终态检查进一步发现:
- 77.61% 有错误字段值
- 43.30% 产生额外副作用
- 25.36% 缺少必要状态或副作用
三类可以重叠。论文还用固定优先级为失败轨迹分配可复现标签,非加权平均结果为工具使用与恢复问题 79.9%、错误状态更新 10.3%、用户问题未闭环 7.0%、没有状态变更 2.9%。这些标签描述可观察现象,不能直接等价为唯一根因。
这组数据把证据层级说得很清楚:Agent 的总结反映它对完成状态的判断;工具调用说明流程有动作;持久化终态才决定业务是否完成。
20 次全胜仍然是一组有限样本
20/20 适合当筛选门槛,也适合暴露单次分数隐藏的波动。它表达的是当前 20 次运行里没有观察到失败。
在简化的独立伯努利模型下,20 次零失败对应的单侧 95% 成功率下界约为 0.05^(1/20)=86.1%。即便样本全胜,底层成功率仍存在不小的不确定区间。生产环境还会遇到相关故障,例如同一供应商中断、共享限流、凭据过期、数据库迁移和并发污染,独立模型的统计边界会进一步收紧。
ThinkingBox 每次都回到相同干净初态。它有效隔离了前一次运行留下的状态,却没有模拟连续二十个真实订单、理赔或权限请求在生产系统里累积影响。因此,这项基准测的是冻结条件下的重复执行可靠性,覆盖不到跨任务长期状态、事故恢复和流量相关失效。
论文还明确列出几项限制:
- 任务来自非公开案例的合成重建,不代表企业工作的总体分布
- 每项只保留一个黄金终态,多种合理解决方案的工作流会被过滤
- 模拟用户目标固定、保持配合,最多进行十轮追问
- 477 项可以在后端更新正确、用户说明错误时仍然通过
- 30 项回复 rubric 与模拟用户都使用 GPT-5.4-mini,公开材料没有提供 rubric 的独立人工校准
因此,合适的结论是 ThinkingBox 在明确的 Harness 下测量了一组可执行业务任务的重复完成度。它提供生产决策证据,还需要本地任务、真实流量和风险门禁继续补强。
能重跑框架,不等于能复核历史榜单
ThinkingBox 的公开程度高于许多 Agent 基准。官方发布了运行框架、任务定义、MCP servers、冻结清单、数据浏览视图、聚合源码和生成逐试次 JSONL 的命令。公开源码也能确认 pass^k 的 plug-in 计算方式。
截至 2026 年 10 月 10 日,公开资产中没有发现论文全部模型实验的完整历史 JSONL。论文附录给出少量代表性完整轨迹,仓库没有提供 18 个模型全部对话、工具结果、Token 记录和逐试次 verdict 的下载包。
外部团队可以复跑一轮新的实验,却无法只依赖作者的公开历史轨迹,重新计算论文中的全部任务成功次数、bootstrap 区间、失败分类和批次相关性。闭源模型持续更新,也会让历史数字越来越难精确复现。
这属于两种不同的证据状态:框架和任务可执行,说明实验能够重新实施;历史轨迹缺失,意味着既有榜单还没有达到逐试次独立复核。类似的边界也适用于程序修复数据集,详见公开检查与独立评测的边界。
把 20 次实验迁移成生产可靠性合同
ThinkingBox 更适合作为设计样板,而非统一要求所有团队照搬二十次。
- 冻结代表性任务、初态、政策、工具、grader、模型路由和预算。
- 分开记录终态正确性、缺失副作用、额外副作用、权限约束和回复忠实度。
- 同时报 pass@1、允许重试后的恢复率、任务级一致性、延迟、成本和人工接管。
- 保存逐试次原始记录,让聚合指标可重算,失败过程可追踪。
- 专门测试供应商中断、共享限流、旧凭据、schema 变化和并发等相关故障。
- 按失败代价确定重复次数和门槛。高风险写操作需要更强证据,低风险查询可以用较轻门禁。
- 离线通过后进入 shadow,再用 canary 核验真实终态、人工接管和回滚信号。
需要落地步骤的团队,可以直接参考把产品终态变成动态发布门禁。
ThinkingBox 给出的核心提醒很克制:一次成功证明 Agent 有能力做成;重复成功只能在指定任务、指定系统配置和指定时间窗口内逐步赢得信任。可靠性是一份可执行的验收合同,而非模型名称自带的属性。
常见问题
ThinkingBox 和 ThinkingBox-Bench 有什么区别?
ThinkingBox 是可复用运行框架。ThinkingBox-Bench 是冻结的 507 项业务任务、工具服务器、政策和检查集合。
Stateful 指长期记忆吗?
这里主要指任务中的工具会改变持久化业务状态,评测器随后检查数据库和副作用。它没有证明 Agent 能长期管理跨任务记忆。
20 次全胜能证明 100% 可靠吗?
它证明该任务在当前配置的 20 次样本中没有失败。未来成功率仍有统计不确定性,生产条件还会引入相关故障。
为什么工具调用成功,任务仍会失败?
调用可能改错对象或字段,也可能漏掉必要后续动作、产生额外副作用,或在前置条件失败后没有恢复。API 成功与业务完成属于不同证据层级。
ThinkingBox 首次提出终态判分和 pass^k 吗?
更早的 tau-bench已经采用终态数据库判分和重复成功指标。ThinkingBox 的增量在于 MCP 兼容运行时、五业务域、明确副作用检查、冻结发布和大规模重复实验的组合。