# OpenAI 首款推理芯片 Jalapeño 实测：每瓦处理量是对比系统的 1.5–1.9 倍，延迟低 1.7–3.6 倍

> 原标题：Jalapeño’s first results show industry-leading speed and efficiency in AI inference

- 来源：OpenAI News
- 发布时间：2026-08-25T07:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52784
- 原文：https://openai.com/index/jalapeno-first-results

## 摘要

OpenAI 公布了自研推理芯片 Jalapeño 的首批实测数据。在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 三个模型上，Jalapeño 峰值吞吐量下每瓦处理量是对比系统的 1.5 到 1.9 倍，端到端延迟低了 1.7 到 3.6 倍。交互式负载下优势更大，达到 2.1 到 4.1 倍。这颗芯片没走“吞吐量...

## 推荐理由

OpenAI 自研芯片 Jalapeño 第一次亮实测成绩，不是概念验证。它在三个主流开源大模型上跑出了每瓦吞吐量和端到端延迟的明确倍数优势，尤其在交互式场景下差距更大。这对推理成本和硬件选型有直接参考价值，也会影响芯片创业公司和云厂商的算力布局。正文没披露对比系统的具体配置和测试环境细节，这点先别太激动，但数据本身已经够让行业认真对待。

## 锐评

OpenAI 公布了 Jalapeño 的第一批实测数据，这颗芯片是他们自己设计的，专门用来跑模型推理（也就是生成回答这一步）。在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 三个模型上，Jalapeño 每瓦电能处理的 token 数是对比系统的 1.5 到 1.9 倍，端到端延迟低了 1.7 到 3.6 倍。交互式负载下优势更大，达到 2.1 到 4.1 倍，说明它在需要快速响应的聊天场景里更占便宜。

这些数字看起来挺漂亮，但得打个折来看。全文没写对比的硬件到底是什么——是英伟达的 H100、B200，还是其他家的卡？也没提芯片用了什么制程工艺、什么时候能量产、定价多少。没有这些信息，很难判断这个领先是架构上的真突破，还是拿新芯片打旧平台。另外，测试用的是他们自己的 GPT-OSS 和别家的开源模型，实际部署到 ChatGPT 这种大规模线上服务时表现如何，正文也没给数据。

还缺一个关键点：芯片设计过程用了 AI 辅助，但没说明这到底省了多少设计时间或人力。整体看，这是一次有保留的亮肌肉，真正值不值得期待，得等第三方实测和量产时间表出来再说。
