跳到正文
OpenAI News

OpenAI 公开 GPT-Live 语音架构:砍掉“轮到你了”检测器,让模型边听边说

How we built a realtime system for responsive voice AI in six months

OpenAI 在 8 月 3 号发了篇工程博文,解释 GPT-Live 怎么做到实时语音对话。核心改动是把旧架构里那个负责判断“用户说完了没”的小模型(turn detector)从音频链路里拿掉了,换成全双工模型,能同时听和说。这解决了以前小模型猜早了抢话、猜晚了反应慢的问题,让大模型直接处理音频流,对话节奏更自然。遇到需要深度推理或调用工具时,系统...

推荐理由:OpenAI 官方工程博文,讲 GPT-Live 从半双工切到全双工语音架构的决策过程,技术细节扎实,面向开发者。不是产品发布稿,是实打实的架构拆解。三条 HKR 都踩中了。分数定在 78 而不是更高,因为正文没给出改完后的延迟、打断准确率这些量化指标,也没说这个方案在弱网或噪音下的表现,判断依据还缺一块。

读原文 ↗导出 Markdown