# OpenAI 发了三个实时语音模型：GPT-Realtime-2、翻译版和 Whisper 版，上下文从 32K 扩到 128K

> 原标题：[AINews] GPT-Realtime-2, -Translate, and -Whisper: new SOTA realtime voice APIs

- 来源：Latent Space
- 发布时间：2026-05-08T07:11:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17519
- 原文：https://www.latent.space/p/ainews-gpt-realtime-2-translate-and

## 摘要

OpenAI 在 Realtime API 里上线了 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。GPT-Realtime-2 是主打的语音对话模型，OpenAI 说它用上了 GPT-5 级别的推理能力，上下文窗口从之前的 32K 直接拉到 128K，一次最多能输出 32K ...

## 推荐理由

我会先打个折：这不是新基础模型，是 API 层面的更新，所以分数没往 90 以上拉。但 128K 上下文和 96.6% 的音频基准分确实够硬，对实时语音应用来说是个实打实的升级。正文没提延迟和具体定价，这点先别太激动，等上线跑过再看。

## 锐评

这次更新重点不是音色多好听，而是让语音模型更“懂事”。它现在能同时调用多个工具，比如边查日历边回你话，还会说“我查一下”这种过渡语，卡壳了也能体面地承认“我现在搞不定”，而不是直接崩掉。上下文窗口从 32K 直接拉到 128K，意味着它能记住更长的对话历史，处理复杂任务时不容易忘事。OpenAI 说它用上了 GPT-5 级别的推理，在 Artificial Analysis 的 Big Bench Audio 测试上拿了 96.6%，比上一代提升了 15.2 个百分点，这个涨幅确实不小。

不过，这些数字都来自 OpenAI 和第三方基准测试，实际产品里表现如何，尤其是高负载下的延迟和成本，正文没细说。另外，开发者可以调推理强度，从“最小”到“超高”有五档，默认是“低”。这给了控制成本的空间，但不同档位效果差多少，也没给具体数据。ChatGPT 里的语音体验什么时候跟上，目前只有一句“在做了”，这点先别太激动。
