Administrator
Published on 2026-08-26 / 0 Visits
0
0

OpenAI Jalapeño 基准审计:全栈推理闭环

OpenAI 首颗自研推理芯片 Jalapeño 的首批数据支持一个明确结论:在三组公开模型测试中,它同时实现了更高的每瓦吞吐和更低的端到端延迟。更重要的结论在架构层。Jalapeño 把芯片、内存、网络、编译器、模型和服务软件接入同一个优化闭环,而长上下文 Agent 负载与生产经济性仍要等待下一轮验证。

阅读时间:7 分钟 · 约 2100 字

TL;DR

  • Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 的公开 InferenceX 对比中领先。
  • 峰值每瓦吞吐优势为 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍。
  • 测试采用固定 8k 输入、1k 输出和单 Token 预测,并按芯片公开 TDP 归一化。
  • SemiAnalysis 在 OpenAI 实验室现场核验了这些运行,也明确说明尚未运行完整套件或看到 AgentX 结果。
  • 如果更广泛测试继续成立,真正难复制的资产是贯穿整条推理栈的反馈闭环。

把三个倍数放回测试单元格

OpenAI 于 2026 年 8 月 25 日公布三组数据。它们都使用公开的 InferenceX 基准,输入长度为 8k、输出长度为 1k,并采用单 Token 预测。

模型 对比系统 峰值混合吞吐 / kW 端到端延迟
GPT-OSS 120B Jalapeño vs GB200 85,448 vs 44,960,约 1.9 倍 1.03 秒 vs 1.80 秒,约低 1.7 倍
DeepSeek R1 670B Jalapeño vs GB300 19,641 vs 11,781,约 1.7 倍 1.65 秒 vs 5.99 秒,约低 3.6 倍
Kimi K2.5 1T Jalapeño vs GB300 18,195 vs 11,862,约 1.5 倍 1.56 秒 vs 5.31 秒,约低 3.4 倍

原始表格还给出了更低的 Token 间延迟,以及在对手最佳交互速度处更高的吞吐。它们共同描述的是一条服务曲线:Jalapeño 在保持响应速度时,仍能承载更多请求。

功耗归一化同样关键。OpenAI 使用每颗加速器公布的封装 TDP 计算每千瓦吞吐:Jalapeño 为 700W,GB200 为 1200W,GB300 为 1400W。OpenAI 同时表示,Jalapeño 在测试负载下的持续实测功耗不超过 550W。因此 700W 分母对 Jalapeño 相对保守,但不同系统仍使用公开封装功耗,而非完全一致的整机墙上功耗。

证据支持的准确结论是:Jalapeño 在已披露配置中形成了更好的延迟与 TDP 归一化吞吐边界。机群经济性、设施功耗、良率、可靠性和利用率需要额外数据。

一颗芯片的结果,本质上是系统结果

一次语言模型推理会连续迁移瓶颈。Prefill 负责处理输入,通常更吃计算;decode 逐 Token 生成,更受内存带宽限制;模型并行引入通信开销;KV cache 放置则决定多少状态需要跨内存和网络移动。

单点优化很容易把等待转移到其他地方。计算单元再快,也可能等跨卡数据;显存再大,也可能输给调度;峰值 Token 数再高,也可能无法满足交互式 Agent 的延迟要求。

OpenAI 对 Jalapeño 的设计覆盖芯片、内存、网络、编译器、运行时和机架系统。系统能够显式放置模型状态,让 KV cache 尽量保持本地,并为不同推理阶段激活合适资源。较大的网络域又让完整负载留在一个互联系统内。

关键变化是:加速器成为控制闭环的一部分,而不是孤立组件。

这条闭环可以观察真实服务负载,判断当前约束来自计算、带宽、通信还是调度,再同时调整软硬件。OpenAI 的全栈战略文章进一步把闭环延伸到模型、产品需求和算力组合。

工程取舍:全面均衡,而非单阶段最优

Jalapeño 用一套通用推理架构运行三类公开模型。SemiAnalysis 报告显示,本次测试采用单 Token 预测,没有使用投机解码,也没有拆分 prefill 与 decode 资源池。一些竞争系统会用更专门的技术取得各自最佳点,因此这个差异很重要。

OpenAI 的选择更接近同质资源池。系统可以吸收输入处理、缓存读写和输出生成比例的变化。它放弃了永久拆分 prefill 与 decode 可能获得的部分理论效率,换取负载变化时更低的错配风险。

这项取舍适合 Agent 基础设施。Agent 流量具有突发、多轮、缓存密集和串行延迟敏感等特点。一个均衡资源池通常比多个狭窄优化池更容易调度和运维。当前数据已经证明它能处理固定序列;真实 Agent 会话图仍是待通过的门槛。

SemiAnalysis 核验了什么

这批数据的证据强度高于单纯厂商幻灯片。InferenceX 的常规运行会公开测试配方、日志、驱动与框架版本、Token、延迟和功耗遥测。SemiAnalysis 表示,其团队进入 OpenAI 实验室,与 OpenAI 工程师一起核验了 Jalapeño 的 InferenceX 运行。

同一份报告也划清了边界:数字由 OpenAI 提供,SemiAnalysis 没有运行完整 InferenceX 套件,也尚未看到 AgentX 结果。

AgentX 是更严格的下一关。它重放长上下文、多轮编程会话,保留共享前缀、停顿、子 Agent 扇出和 KV cache 复用。其请求长度显著高于 8k,还会在一小时分析窗口中持续施压路由、缓存策略、调度和尾延迟。

当前证据可以分为四级:

  1. 实体芯片存在,并已运行三个公开模型家族。
  2. 固定序列 InferenceX 显示出强服务边界。
  3. 独立观察者在实验室现场核验了这些运行。
  4. AgentX、公开原始产物、生产稳定性与完整经济性仍待验证。

下一轮基准应审计整条闭环

下一轮测试应覆盖速度之外的系统指标。

  • AgentX: 长上下文、多轮会话、前缀复用和子 Agent 突发。
  • 整机实测功耗: 在同一服务等级下测量加速器、主机、内存、网络与冷却。
  • 质量等价: 对每种优化模式做任务质量检查,尤其是低精度与投机解码。
  • 机群行为: 观察数周的尾延迟、故障恢复、降级节点、升级和利用率。
  • 经济性: 纳入芯片良率、机架、网络、运维、折旧和每美元有效 Token。
  • 可迁移性: 验证模型架构变化后,是否仍能避免大规模专用改写。

这些门槛若继续通过,OpenAI 将获得一条可信的第一方算力路径,同时保留外部供应商作为可选择资源。其直接效果可能包括更强议价能力、更低服务成本,以及模型设计到线上性能之间更短的反馈周期。

战略资产是控制闭环

Jalapeño 的首批基准值得关注,因为一代自研系统已经在三个公开模型上进入 Pareto 前沿。它的战略意义来自一项更难复制的能力。

OpenAI 能观察前沿模型在产品中的负载形态,围绕这些负载重做服务栈、芯片与网络,再把结果反馈给模型和产品决策。芯片只是这条闭环中的一个执行器。

对基础设施采购者,最实际的行动是按真实用户体验和真实负载评测系统。每芯片峰值 Token 仍有参考价值,最终决定价值的是匹配延迟、功耗、缓存行为、稳定性与单次合格任务成本。

下一步:把每条新加速器声明转成测试矩阵。先冻结模型、精度、序列形态、质量目标、延迟目标与功耗边界,再比较数字。

常见问题

OpenAI Jalapeño 比 NVIDIA Blackwell 快吗

在已披露的三组 8k/1k InferenceX 对比中,Jalapeño 的 TDP 归一化吞吐更高、延迟更低。现有公开证据尚未覆盖所有模型、服务技术、长上下文负载和完整总成本边界。

InferenceX 是什么

InferenceX 是 SemiAnalysis 维护的开放持续推理基准,用真实加速器和服务栈测量吞吐、交互速度、延迟、能耗与成本,并公开配方和运行产物。

为什么 AgentX 很重要

AgentX 重放长上下文、多轮 Agent 会话,并保留共享前缀与子 Agent 扇出。这些模式会同时施压 KV cache、路由、调度和尾延迟,固定 8k/1k 请求无法覆盖它们。

全栈推理是什么意思

全栈推理把模型、编译器、服务运行时、芯片、内存、网络和机架当成一个系统,在延迟、功耗、可靠性和成本约束下优化最终完成的用户工作。

参考资料


Comment