OpenAI 首款推理芯片 Jalapeño 实测:每瓦处理量是对比系统的 1.5–1.9 倍,延迟低 1.7–3.6 倍
Jalapeño’s first results show industry-leading speed and efficiency in AI inference
OpenAI 公布了自研推理芯片 Jalapeño 的首批实测数据。在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 三个模型上,Jalapeño 峰值吞吐量下每瓦处理量是对比系统的 1.5 到 1.9 倍,端到端延迟低了 1.7 到 3.6 倍。交互式负载下优势更大,达到 2.1 到 4.1 倍。这颗芯片没走“吞吐量...
推荐理由:OpenAI 自研芯片 Jalapeño 第一次亮实测成绩,不是概念验证。它在三个主流开源大模型上跑出了每瓦吞吐量和端到端延迟的明确倍数优势,尤其在交互式场景下差距更大。这对推理成本和硬件选型有直接参考价值,也会影响芯片创业公司和云厂商的算力布局。正文没披露对比系统的具体配置和测试环境细节,这点先别太激动,但数据本身已经够让行业认真对待。