# OpenAI 在 API 里上线了三款实时语音模型，能边听边推理、翻译和转写

> 原标题：Advancing voice intelligence with new models in the API

- 来源：OpenAI News
- 发布时间：2026-05-07T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16300
- 原文：https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api

## 摘要

OpenAI 这次发了三个新模型：GPT‑Realtime‑2 是带 GPT‑5 级推理能力的语音模型，能处理更复杂的请求，说话中间可以插话、改主意，它还能边想边回一句“我查一下”，同时调用多个工具；GPT‑Realtime‑Translate 做实时翻译，支持 70 多种输入语言转 13 种输出语言，语速跟得上说话人；GPT‑Realtime‑Whi...

## 推荐理由

OpenAI 官方放出了语音 API 更新，方向明确但信息不全。能推理、翻译、转写，听着挺全，可没给价格、没给延迟、没给上下文限制，我会先打个折。如果是真的省钱又低延迟，那对语音应用开发者是直接利好；现在只能说方向对了，落地还得等更多参数。

## 锐评

OpenAI 这次把 GPT-5 级别的推理塞进了语音模型 GPT-Realtime-2，让它能边听边想、中途插话、同时调用多个工具，不再是简单的“你问我答”。另外两个模型分别做实时翻译和流式转写：翻译支持 70 多种输入语言转 13 种输出语言，号称能跟上说话人的语速；转写模型则是在说话过程中同步出文字。

从场景看，这三个模型瞄准的是让语音从“对话”变成“干活”——比如 Zillow 用它直接搜房、约看房时间，或者旅行 App 主动播报延误和换乘路线。但整篇公告没提最关键的东西：每分钟多少钱、能扛多少并发、端到端延迟到底多少毫秒。这些数字直接决定开发者能不能用在客服或实时会议里。另外，翻译只支持 13 种输出语言，覆盖面有限，多语种互译场景还缺一块。

整体方向是对的，但没报价没压测的发布，更像技术预告而非可投产的 API。
