# OpenAI 发布 Realtime API 公测版，让开发者直接调用 GPT-4o 做低延迟语音对话

> 原标题：Introducing the Realtime API

- 来源：OpenAI News
- 发布时间：2024-10-01T10:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/698
- 原文：https://openai.com/index/introducing-the-realtime-api

## 摘要

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版，所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接，把音频直接流式传给 GPT-4o，再流式返回语音，省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低，能保留语气和重音，还能自动处理用户插话。API 支持函数调用，...

## 推荐理由

OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o，延迟和打断处理都内建了，还给了函数调用和明确定价。对做实时语音 agent 的开发者来说，这是可以直接动手试的东西，不是概念稿。我会先打个折：公测阶段稳定性、实际延迟和成本还没大规模验证，但信息量和可操作性已经足够当天写。

## 锐评

这条更新对做语音产品的开发者来说，是把之前要拼三个模型（语音识别、文本生成、语音合成）的活，简化成调一个接口。好处是延迟更低，能保留语气和重音，还能自动处理用户插话，这些在以前的串联方案里很难做好。

价格方面，文本输入每百万 token 收 5 美元，音频输入每百万 token 收 100 美元，差距有 20 倍。如果你做的不是必须实时对话的场景，OpenAI 自己也说可以用 Chat Completions API 的音频模式，成本会低很多。另外，正文提到后续会出缓存定价，文本能降到 2.5 美元，音频降到 20 美元，但具体什么时候上线没说。

目前缺的信息是：这个 API 在不同语言、带口音或嘈杂环境下的表现怎么样，以及大规模商用时的并发限制和实际延迟数据。这些对判断它能不能直接上生产环境很关键。
