# OpenAI 发了三款新语音模型：两个听写，一个会学语气说话

> 原标题：Introducing next-generation audio models in the API

- 来源：OpenAI News
- 发布时间：2025-03-20T11:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/603
- 原文：https://openai.com/index/introducing-our-next-generation-audio-models

## 摘要

OpenAI 在 3 月 20 日往 API 里塞了三个新音频模型：gpt-4o-transcribe 和 gpt-4o-mini-transcribe 负责把语音转成文字，gpt-4o-mini-tts 负责把文字念出来。听写模型在 FLEURS 等多语言基准上跑分比 Whisper v2、v3 都低，低的是词错率，说明在口音重、环境吵、语速快的时候...

## 推荐理由

OpenAI 在 API 里发了三个音频模型，给了具体的基准和机制细节，所以 HKR 三项都过了，featured 没问题。分数我维持 84，没往上加，因为正文没披露价格、延迟，基准对比也只给了 FLEURS 一个点，信息还不够全。

## 锐评

这次更新核心就两件事：一是把语音转文字（STT）的准确率拉上去了，二是让文字转语音（TTS）能听懂人设指令，比如“用同情的客服语气说话”。

STT 这边，gpt-4o-transcribe 和 mini 版在 FLEURS 等多语言基准上，词错率（WER）比 Whisper v2、v3 都低。WER 越低越好，说明在口音重、环境吵、语速快的场景下，转录更靠谱。技术底子靠的是强化学习和大规模多风格音频数据的“中期训练”，不是简单微调。但正文没给具体 WER 数值，只放了对比图，也没提不同语言间的表现差异有多大。

TTS 这边，gpt-4o-mini-tts 首次允许开发者用文字描述想要的说话风格，不再只能选固定音色。这是个实用进步，能让客服、有声书等场景的语音更自然。不过，正文明确说目前只开放“受监控的预设合成声音”，意味着风格可控，但音色库还是锁死的，不能克隆真人声音。

最大的信息缺口是成本和延迟。API 已经可用，但整篇文章没提每分钟转录或合成多少钱，也没说端到端延迟能压到多少毫秒。对做实时语音 agent 的人来说，这两项比准确率更致命。另外，这些模型目前只在 API 里，没进 ChatGPT 产品端，所以普通用户还用不上。
