这次更新核心就两件事:一是把语音转文字(STT)的准确率拉上去了,二是让文字转语音(TTS)能听懂人设指令,比如“用同情的客服语气说话”。
STT 这边,gpt-4o-transcribe 和 mini 版在 FLEURS 等多语言基准上,词错率(WER)比 Whisper v2、v3 都低。WER 越低越好,说明在口音重、环境吵、语速快的场景下,转录更靠谱。技术底子靠的是强化学习和大规模多风格音频数据的“中期训练”,不是简单微调。但正文没给具体 WER 数值,只放了对比图,也没提不同语言间的表现差异有多大。
TTS 这边,gpt-4o-mini-tts 首次允许开发者用文字描述想要的说话风格,不再只能选固定音色。这是个实用进步,能让客服、有声书等场景的语音更自然。不过,正文明确说目前只开放“受监控的预设合成声音”,意味着风格可控,但音色库还是锁死的,不能克隆真人声音。
最大的信息缺口是成本和延迟。API 已经可用,但整篇文章没提每分钟转录或合成多少钱,也没说端到端延迟能压到多少毫秒。对做实时语音 agent 的人来说,这两项比准确率更致命。另外,这些模型目前只在 API 里,没进 ChatGPT 产品端,所以普通用户还用不上。