OpenAI 于 2026 年 8 月 25 日公布自研推理芯片 Jalapeño 的首批测试结果。原帖的核心主张不是单纯追求峰值吞吐,而是在相近用户体验下,同时改善单位功耗吞吐和端到端延迟,面向需要连续执行许多步骤的交互式 Agent 工作负载。
原线程与中文翻译
Since announcing Jalapeño, our first custom inference chip, we’ve been testing it and the system around it. The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency.
自从公布首款自研推理芯片 Jalapeño 以来,我们一直在测试芯片及其配套系统。结果显示其取得了显著进展:每瓦可提供更多智能计算并带来更快响应,在不牺牲效率的前提下,以同一架构同时实现更高吞吐和更低延迟。
Jalapeño means faster ChatGPT responses, more responsive Codex sessions and agents, and reliable access as demand continues to grow.
Jalapeño 意味着更快的 ChatGPT 响应、更灵敏的 Codex 会话和 Agent,以及在需求持续增长时更可靠的服务访问。
We plan to begin deploying Jalapeño in OpenAI’s compute infrastructure by year-end. It’s the first step in a multigenerational roadmap: Gen 2 is deep in development, and Gen 3 is taking shape. Each generation will push efficiency and speed further.
我们计划在今年年底前开始把 Jalapeño 部署到 OpenAI 的计算基础设施中。这是多代产品路线图的第一步:第二代已进入深入开发阶段,第三代也在成形。每一代都将进一步提升效率与速度。
发布日期:2026 年 8 月 25 日。
测试方法与关键数据
根据 OpenAI 同日发布的技术说明,测试使用 SemiAnalysis 的公开基准 InferenceX,覆盖一次 AI 请求的完整服务过程,并在从高吞吐到低延迟交互的多个运行点比较系统。测试模型包括 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T;附录给出的典型请求长度为 8k 输入、1k 输出。
为减少“每芯片”口径造成的偏差,OpenAI 按各加速器公开的封装功耗额定值归一化。Jalapeño 的额定功耗为 700 W,OpenAI 称测试中的持续实测功耗不高于 550 W。其公开结果包括:
- GPT-OSS 120B:峰值单位功耗吞吐约为对照系统的 1.9 倍,端到端延迟约低 1.7 倍。
- DeepSeek R1 670B:峰值单位功耗吞吐约为 1.7 倍,端到端延迟约低 3.6 倍。
- Kimi K2.5 1T:峰值单位功耗吞吐约为 1.5 倍,端到端延迟约低 3.4 倍。
这些数字均来自 OpenAI 自己的测试和披露。这里的“低 X 倍”沿用原文表达,实际核验时应直接比较附录中的秒数、TBT(time between tokens)和 TPS/kW,避免把倍数口径理解错。
为什么可能同时改善吞吐与延迟
原作者说明,语言模型推理的不同阶段瓶颈不同:prefill 更偏计算密集,逐 token 的 decode 更受内存带宽约束,多芯片通信还会引入等待。Jalapeño 因此把芯片、内存、网络、软件和机架级系统一起设计,并让 KV cache 等模型状态尽量就地放置,减少数据移动和通信延迟。
OpenAI 还称 AI 直接参与了芯片设计与编程:从初始设计到 tapeout 用时九个月;Codex 与 GPT-Astra 在两个月内把三个原本不在生产计划中的开放权重模型优化到较高性能;在部分 GPT-OSS attention 和 MoE 模块上,AI 生成实现比既有人类专家实现快 1.5 至 1.8 倍。最后一项只适用于被选中的模块,不代表完整模型获得同等加速。
如何验证,以及适用边界
若要复核,应至少固定模型版本与精度、8k/1k 输入输出长度、并发与批处理策略,并同时记录端到端延迟、首 token 延迟、TBT、每用户 token 速率、整机持续功耗和 TPS/kW;只比较芯片 TDP 或单一峰值吞吐都不足以复现结论。
Codex 归纳:这组结果最有价值的部分是公开了三种模型、多个运行点和相对完整的单位功耗指标,但目前仍是厂商自测,不是独立复现,也不等同于实际产品 SLA。Jalapeño 尚在生产资格验证、软件成熟和规模化运行准备阶段;计划于 2026 年底前开始部署,不代表已经全面上线。原文没有给出芯片售价、总体拥有成本、良率、集群规模或第三方实测,因此不能据此直接推断成本优势。
原作者:OpenAI(@OpenAI),2026 年 8 月 25 日
原帖:OpenAI on X: "Since announcing Jalapeño, our first custom inference chip, we’ve been testing it and the system around it. The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without" / X