# OpenAI 把 GPT-5 级推理塞进语音模型，同传翻译成本打到地板价

> 原标题：GPT-5级推理能力塞进语音模型，OpenAI把同传翻译成本砍穿地板价

- 来源：量子位 · 公众号
- 发布时间：2026-05-08T04:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16533
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247889299&idx=2&sn=e1ba7eebd25734faaa35c8f3fbd3a04b

## 摘要

OpenAI 发了三个实时语音模型：GPT-Realtime-2 能边听边推理，上下文窗口 128K；GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出，做流式同传；GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据，实际效果还得等上手测。

## 推荐理由

OpenAI 一口气发了三个实时语音 API，覆盖推理、翻译和转写，HKR 全中。128K 上下文意味着能处理很长的对话，70 多种语言输入和每分钟 0.017 美元的转写价格，对做同传和语音 agent 的团队来说，成本和能力边界都清楚了，值得当天就写。

## 锐评

OpenAI 这次发了三个实时语音模型，核心是把强推理能力直接做进语音通道。GPT-Realtime-2 能边听边推理，上下文窗口拉到 128K，相当于模型可以记住很长一段对话的前后文再给反应，不是简单的一问一答。GPT-Realtime-Translate 做流式同传，支持 70 多种语言输入、13 种语言输出，覆盖范围挺广。GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元，这个价格确实低，如果效果稳定，对需要大量转写的场景会很省钱。

不过正文没披露具体的推理跑分，也没给翻译延迟数据。同传最怕延迟高，差个几百毫秒体验就完全不一样。另外 128K 上下文在纯语音场景下实际能用多少、长对话会不会丢信息，这些都得等上手实测才知道。目前只能当产品发布看，别急着对标 GPT-5 的文本推理水平。
