OpenAI 把 ChatGPT 的全双工语音能力做成 API 了,叫 GPT‑Live‑1
Build more natural voice experiences with GPT‑Live‑1 in the API
OpenAI 发布了 GPT‑Live‑1,一个能同时听和说的语音模型,之前只在 ChatGPT 里用,现在开放给开发者接 API。它把语音识别、理解和合成合到一个模型里,不再需要把 STT、LLM、TTS 串起来,省掉了中间环节的延迟和状态丢失。语言学习产品 Speak 试过后说,学生回答前的等待时间变长了,系统打断学生的次数比之前的轮流对话方案少了...
推荐理由:OpenAI 把 ChatGPT 的全双工语音模型拆出来做成 API,对做语音产品的团队是直接可用的更新。我会先打个折:Speak 的反馈说明生产环境里延迟和打断的平衡还没完全调好,但管线简化本身省掉不少工程麻烦。正文没披露定价和并发限制,这点先别太激动。