# OpenAI 公开 GPT-Live 语音架构：砍掉“轮到你了”检测器，让模型边听边说

> 原标题：How we built a realtime system for responsive voice AI in six months

- 来源：OpenAI News
- 发布时间：2026-08-03T07:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48570
- 原文：https://openai.com/index/continuous-voice-interaction-with-gpt-live

## 摘要

OpenAI 在 8 月 3 号发了篇工程博文，解释 GPT-Live 怎么做到实时语音对话。核心改动是把旧架构里那个负责判断“用户说完了没”的小模型（turn detector）从音频链路里拿掉了，换成全双工模型，能同时听和说。这解决了以前小模型猜早了抢话、猜晚了反应慢的问题，让大模型直接处理音频流，对话节奏更自然。遇到需要深度推理或调用工具时，系统...

## 推荐理由

OpenAI 官方工程博文，讲 GPT-Live 从半双工切到全双工语音架构的决策过程，技术细节扎实，面向开发者。不是产品发布稿，是实打实的架构拆解。三条 HKR 都踩中了。分数定在 78 而不是更高，因为正文没给出改完后的延迟、打断准确率这些量化指标，也没说这个方案在弱网或噪音下的表现，判断依据还缺一块。

## 锐评

这篇工程博文讲的是 GPT-Live 怎么从“你一句我一句”变成“全双工”实时对话。旧架构里有个小模型专门判断用户说完了没，猜早了抢话，猜晚了反应慢。新方案直接把这个环节砍了，让语音模型同时处理听和说，对话节奏更接近真人。遇到需要深度推理或调工具的任务，系统会异步把活派给 GPT-5.5 这种更大的模型，不卡住语音流。团队花了六个月重写了推理、上下文管理和媒体传输，目标是端到端低延迟。

文章说这套架构已经用在 ChatGPT 桌面版的电脑控制和智能体协调上，但没披露任何具体的延迟数字，也没说覆盖了多少用户。这让人没法判断“更自然”到底提升了多少。另外，全双工模型在嘈杂环境下的表现、误打断率这些关键指标也没提。整体看，思路清晰，工程上把语音交互的实时性和智能性解耦了，但效果验证还缺硬数据。
