
在周二的 Hot Chips 大会上,OpenAI 首次详细披露了自研推理芯片 Jalapeño 的架构细节,并同步释出了首批基准测试成绩。在 SemiAnalysis 的 InferenceX 基准评测中,Jalapeño 在"每用户生成 token 数"和"每千瓦吞吐量"两项指标上,均超越了目前可用的最强推理处理器。
核心亮点:性能远超现有最强方案
OpenAI 硬件负责人 Richard Ho 在媒体通气会上表示:
"结论非常明确:相比当前最强推理芯片,Jalapeño 展现出极其显著的性能提升。它能在更低功耗下承载更多 AI 推理任务,同时返回结果的速度也更快。它既适合大规模用户并发,也能保持极低延迟。"
值得注意的是,这一对比参照的是 Nvidia Blackwell 系统。不过 Ho 也指出,等到 Jalapeño 真正大规模部署时,竞争对手的产品可能已经迭代了多代。
落地时间线
| 阶段 | 时间 | 说明 |
|---|---|---|
| 小规模上线 | 2026 年底 | 仅"非常小的量" |
| 规模部署 | 2027 年 | 产能与生态更为成熟 |
Jalapeño 于去年 10 月正式对外公布,由 OpenAI 与 Broadcom 深度合作开发,OpenAI 自家模型也参与到了设计流程中。OpenAI 已明确将 Jalapeño 定位为多代际平台,即 AI 产品、模型、芯片与内存将协同演进。
技术思路:解决推理各阶段的摩擦点
Jalapeño 采用全栈协同设计理念,针对推理过程中频繁造成瓶颈的环节进行专项优化。团队在官方博客中指出:
"Jalapeño 的设计核心是最大限度减少数据移动和通信延迟。具体来说,模型状态(包括生成响应时使用的 KV 缓存)在整个推理过程中可以精确放置并保持本地化,让系统在每个推理阶段精准激活所需的计算、内存与网络组合。"
这意味着 prefill 阶段和通信阶段的延迟将得到有效压缩——这两个阶段通常是推理管线中的主要瓶颈。
影响与建议
Jalapeño 的出现标志着大厂自研推理芯片的军备竞赛进入新阶段。对 AI 基础设施采购方而言:
- 关注 2027 年实际部署表现,彼时 Nvidia 等竞争对手的产品迭代情况将直接影响对比结论;
- 功耗效率是本次披露的核心优势,企业在评估 TCO(总拥有成本)时可重点参考"每千瓦 token 生成量";
- OpenAI 明确 Jalapeño 是多代际平台,首代产品更像是概念验证与生态奠基,而非最终形态。


评论