# OpenAI 发布 GPT-Realtime-2，一个号称 GPT-5 级推理能力的实时音频模型

> 原标题：绝杀！OpenAI正式接管人类耳朵，首个GPT-5级推理音频模型来了

- 来源：新智元 · 公众号
- 发布时间：2026-05-12T11:26:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20552
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652699783&idx=2&sn=f7674cd7caa9ab1af25a0b93e17ef1bf

## 摘要

OpenAI 推出了 GPT-Realtime-2，官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口，提供五档推理强度可选，API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过，这篇文章因...

## 推荐理由

OpenAI 同一天发的产品更新，实时音频推理是个硬功能，不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果，32/64 美元的定价也给了算账依据。我会先打个折：正文没提延迟数据和实际录音样本，这点先别太激动。但语音 agent 的落地成本一直是瓶颈，这篇信息密度够，值得推给做实时交互的从业者。

## 锐评

OpenAI 这次把音频模型直接挂上了“GPT-5 级推理”的标签，野心不小。从摘要看，GPT-Realtime-2 支持 128K 上下文窗口，意味着它能一次性处理很长的对话或会议录音，不用频繁切段。五档推理强度可选，给了开发者在响应速度和思考深度之间做取舍的空间，这点比较实用。定价是每百万输入 token 32 美元、输出 64 美元，不算便宜，但如果是真能替代一部分需要人脑去听的复杂任务，这个成本账可以再算。

不过，这篇报道的正文因为微信环境验证被屏蔽了，我没看到实际测试案例、延迟数据，也没看到它跟上一代或竞品的直接对比。官方说“GPT-5 级推理”，但没披露具体用什么基准测试来证明，这点先别太激动。配套的翻译和转写工具具体强在哪，正文也没展开。想判断它是不是真能“接管耳朵”，还得等实测跑完延迟和准确率再说。
