
OpenAI Jalapeño 首批实测:每瓦吞吐最高约 1.9×,年底前部署
解读 OpenAI 官网 8 月 25 日工程文:自研推理芯片 Jalapeño 在 InferenceX 上的公开数字、架构取舍、AI 助设计,以及年底前内部部署计划。
原文:Jalapeño’s first results show industry-leading speed and efficiency in AI inference
发布:2026 年 8 月 25 日 · OpenAI Engineering
OpenAI 公布了自研推理芯片 Jalapeño 的首批公开实测。核心主张很明确:不是在「更高吞吐」和「更低时延」之间二选一,而是用同一套架构两边一起抬。1

官方配图:Jalapeño 芯片实拍,来自 OpenAI 原文。
测了什么
评测用的是 SemiAnalysis 公开基准 InferenceX,覆盖一次推理请求的完整服务过程,并和市面上可买到的主流加速系统对比。官方强调:更有用的尺子是单位功耗能完成多少有效 AI 工作,而不是单芯片峰值。1
三款公开模型都测了:GPT‑OSS 120B、DeepSeek R1、Kimi K2.5 1T。对比时按各加速器公布的芯片功耗做了归一:Jalapeño 标称 700 W,官方写实测持续功耗可压到 ≤550 W。1
关键数字
三款模型合在一起,官方给出的区间是:
| 指标 | 相对对比系统 |
|---|---|
| 峰值每瓦有效吞吐 | 约 1.5–1.9× |
| 端到端时延 | 约 1.7–3.6× 更低 |
| 高交互负载性能 | 约 2.1–4.1× |
上表区间来自 OpenAI 对三款公开模型的汇总表述。1
附录里把 GPT‑OSS 120B 写得更细(对比系统功耗按 GB200 1,200 W):
- 峰值 mixed TPS/kW:约 1.9×(85,448 vs 44,960)1
- 端到端时延:约 1.7× 更低(1.03 s vs 1.80 s)1
- 最低 TBT:约 2.7× 更低(0.69 vs 1.87 ms;约 1,459 vs 535 tok/s/user)1
- 在对比系统原先的 TBT 点上,每千瓦吞吐约 53.7×(22,935 vs 427 mixed/kW)1
DeepSeek R1、Kimi K2.5 上也能看到类似形态:峰值每瓦约 1.7× / 1.5×,端到端时延约 3.6× / 3.4× 更低;在「对齐旧系统 TBT」时,每千瓦吞吐拉开到约 104× / 56×。1
官方还写:内部测自家前沿模型时,优势还会再拉开——但公开附录只给了上面三款开源权重模型。1
为什么能同时快和省
语言推理分阶段:prefill 更吃算力,decode 更吃内存带宽;核间、芯片间通信一拖,有些单元就会空等。Jalapeño 的设计目标是少搬数据、少等通信:把含 KV cache 在内的模型状态尽量就近放,并按阶段调度算力、内存和网络;网络被写成架构的一部分,让整次请求尽量留在同一连通系统里。1
文中把它概括成:一个在 prefill 与 decode 之间都能站得住、又能跟着 agent 工作负载比例变化的加速器。1
AI 参与设计和编程
OpenAI 说 AI 直接参与了芯片研发:从初设到 tapeout 大约 9 个月,并拿 AI 优化算术电路、缩短设计—测量—验证循环。芯片本身也被做成对人和 AI 都更可预测的编程目标(本地 tensor、显式通信、可预期同步)。1
用 Codex 搭配 GPT‑Astra,团队把三款原先不在量产计划里的开源权重模型,在约 两个月内推到高性能;在部分 GPT‑OSS 的 attention / MoE 块上,AI 生成的实现比既有人工专家实现快约 1.5–1.8×——官方注明这是选中的块,不是整模。1
部署时间与边界
计划 今年年底前开始在 OpenAI 自有算力里部署 Jalapeño;这是多代路线的第一代,Gen 2 已在深度开发,Gen 3 在成形。1
官方同时写明:训练和推理仍会继续大规模使用 NVIDIA 及其他合作伙伴的加速器。眼前还在做量产鉴定、软件成熟、规模化运维,以及更多模型的性能验证。1
这篇对谁有用
- 跟推理成本、agent 时延、自研硅的人:这是 OpenAI 第一次把 Jalapeño 放到公开 InferenceX 数字上。
- 采购或对标加速器的人:注意对比用的是公布 TDP 归一,且对比系统在附录里按模型写成 GB200 / GB300 功耗档。
- 写「OpenAI 全栈」叙事的人:可与同日 CFO 文《The full stack behind abundant intelligence》对读,但本篇只拆芯片实测这一篇。
数字全部来自 OpenAI 官网原文;第三方复测、代工与供货细节文中未给。
Fuentes de referencia
- 1
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
