# OpenAI 发布 gpt-realtime 模型，语音 API 正式上线并支持电话和图片输入

> 原标题：Introducing gpt-realtime and Realtime API updates

- 来源：OpenAI News
- 发布时间：2025-08-28T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/486
- 原文：https://openai.com/index/introducing-gpt-realtime

## 摘要

OpenAI 把 Realtime API 从公测转成了正式版，同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路，而是直接处理音频，延迟更低，语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显：Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%，Mu...

## 推荐理由

这不是小修小补，是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点，虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力，但配合 MCP 远程服务器和 SIP 通话，语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据，实际部署成本还得自己测，但方向是对的，所以给到 p1。

## 锐评

OpenAI 这次发布的 gpt-realtime 模型，核心变化是不再把你说的话先转成文字、生成回复再念出来，而是直接处理音频。好处是反应快，能保留笑声、语气这些非语言信息，听起来更像人在聊天。官方给了两个基准分：Big Bench Audio 推理从去年底的 65.6% 提到了 82.8%，另一个 MultiChallenge 从 20.6% 提到了 30.5%。分数涨了不少，但要注意这些都是内部评测，没有第三方验证，而且 30.5% 这个绝对分数说明在复杂音频任务上离“好用”还有距离。

这次 API 正式版还加了三个实用功能：支持远程 MCP 服务器（让模型能连外部工具干活）、能看懂图片、以及通过 SIP 协议直接接打电话。这意味着开发者可以把语音助手直接塞进客服系统或业务流程里，不用再自己拼装一堆组件。Zillow 的 AI 负责人说新模型能处理多步骤请求，比如按生活方式筛房源，听起来挺美好，但正文没披露实际部署后的延迟数据和用户留存率，也没提在嘈杂环境下的表现。

价格和可用性部分正文没展开，只提了会单独定价。如果你打算用在生产环境，建议先拿自己的场景测一下工具调用准确率和打断恢复能力，别只看基准分就上头。
