同一个 GPT-6 Astra,在 ARC-AGI-3 Semi-Private 上可以得到 62.7%,也可以得到 99.9%。这组数字说明的重点,是 Agent 能力属于模型、状态、接口与运行时组成的完整系统。标题还藏着两个统计条件:两个最佳分数使用了不同推理强度;3.66 倍速度与少 49% token 只统计双方都成功的 167 个配对。
先把两组最佳分数拆开
ARC Prize 官方文章给出的 Standard harness 最佳结果是 max 推理下 62.7%,成本 26,098 美元;Provider Adapter 最佳结果是 high 推理下 99.9%,成本 18,817 美元。固定结果页显示的两位小数分别为 62.71% 和 99.95%。
最佳值相差 37.24 个百分点,成本下降 27.90%。但这里同时改变了 Harness 和推理强度。真正适合判断 Harness 影响的是同强度配对:
| 推理强度 | Standard | Provider Adapter | 差值 | 成本变化 |
|---|---|---|---|---|
| max | 62.71% | 98.55% | +35.84 pp | -33.59% |
| xhigh | 59.34% | 98.44% | +39.10 pp | -51.37% |
| high | 54.82% | 99.95% | +45.13 pp | -53.77% |
| medium | 38.59% | 98.44% | +59.85 pp | -59.90% |
| low | 17.45% | 98.03% | +80.58 pp | -44.20% |
| none | 35.18% | 96.72% | +61.54 pp | -52.89% |
同为 max 时,分数仍从 62.71% 升到 98.55%。六档推理强度全部显示巨大差异,足以确认完整配置的影响。现有公开实验还没有分别消融 reasoning state、compaction 与 API 行为,所以每个组件贡献多少仍是未知数。
这与站内的 AI Agent 评测缺口形成清晰分工:前文给出通用评测框架,本文用 Astra 做一次具体的计量审计。
99.9% 不是游戏解出率
ARC-AGI-3 测的是 Relative Human Action Efficiency,简称 RHAE。Agent 要在陌生环境中探索规则、识别目标、建立世界模型并规划动作。官方定义中的 100%,指每个游戏都能以不低于人类基线的效率完成。
RHAE 同时计算关卡完成程度和动作效率,后期关卡权重更高,过量探索会降低得分。因此 99.9% 表示这套配置在该协议下接近满分,不代表解出 99.9% 的游戏,也不代表现实任务有 99.9% 成功率。
动作效率与计算效率也要分开。Agent 可以在两次环境动作之间消耗大量推理 token。RHAE 衡量获取外部经验需要多少动作,成本和 token 衡量计算投入。生产选型需要同时观察两组指标。
Provider Adapter 移动了哪个瓶颈
ARC-AGI-3 代码仓说明,两条路径使用相同游戏、动作、限制和评分,区别集中在状态如何跨轮保留。
Standard harness 使用跨供应商的文本历史。模型必须把值得保留的信息写成可见 notes;上下文超过限制后,客户端从旧轮次开始裁剪。长期任务的瓶颈落在模型能否持续提炼有效状态。
Provider Adapter 接入 OpenAI 原生会话合同。公开实现会在请求间传递加密 reasoning items,并接收供应商生成的 compaction item。压缩发生后,客户端保留最新压缩状态及后续内容。评测者能审计传输逻辑,但看不到 opaque reasoning state 的具体内容。
这两种 Harness 回答不同问题。Standard 更适合比较模型通过统一接口时的表现。Provider Adapter 更接近用户实际购买的 OpenAI 完整栈。状态表示与压缩一旦成为最紧约束,改变 Harness 就可能比更换模型更有效。
3.66 倍与 49% 的分母
ARC Prize 报告 Provider Adapter 的聚合记录耗时约快 3.66 倍,总 token 少 49%。换算后,Adapter 耗时约为 Standard 的 27.32%,减少 72.68%;token 约为 Standard 的 51%,Standard 约是 Adapter 的 1.96 倍。
这些数字覆盖 Public 与 Semi-Private、全部推理强度,但只纳入两个 Harness 都解出的 167 个 game-reasoning 配对。这个成功交集适合比较共同成功任务的资源效率。单边失败、重试和超时消耗没有进入分母,因而不能代表全量任务成本。
公开文章提供的是 aggregate elapsed time,也没有 P50、P95、P99。代码虽然记录逐 step 耗时和输入、输出、推理、缓存 token,公开仓库目前缺少 12 个 Astra 配置的完整冻结文件,以及 167 个配对的原始聚合表。外部可以核验方法和公开 replay,暂时无法独立复算两项资源结论。
实际采购前还需要测全量失败率、重试成本、尾延迟、每个合格任务成本,并冻结模型版本、Adapter commit、状态策略、压缩阈值和预算。这也是 真实工作流推理评测强调的基本纪律。
一张榜单应拆成两个问题
跨供应商研究需要 Standard harness,以统一接口换取可比性。产品选型需要 Provider Adapter,以供应商原生能力观察可达到的系统上限。两种结果都有效,前提是分栏展示、完整标注配置,并把结论限制在对应边界内。
Astra 的 62.7% 与 99.9% 没有给出一个新的模型常数。它揭示了 Agent 系统的真实计量单位:模型加记忆、接口、压缩和运行策略。
FAQ
Astra 的 99.9% 代表什么?
它是接近满分的 RHAE,综合反映完成程度与相对人类的动作效率。它不是普通 accuracy 或游戏解出率。
分数差异可以全部归因于 Harness 吗?
最佳值还改变了推理强度。同为 max 时是 62.71% 对 98.55%,说明配置差异依然很大;各 Adapter 组件的独立贡献尚无公开消融结果。
Standard 与 Provider Adapter 的核心区别是什么?
Standard 保留模型写下的可见 notes。Provider Adapter 还保留 OpenAI 原生不透明 reasoning state,并使用供应商 compaction 管理长会话。
3.66 倍速度和少 49% token 能复算吗?
官方公开了统计范围和相对值,但尚未公开 167 个共同成功配对的完整聚合输入,所以目前只能归因引用,无法独立复算。
接近满分是否证明 AGI?
ARC Prize 明确把结论限制在确定性、封闭目标的交互环境。开放现实世界的泛化与可靠性仍需其他证据。