# Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

> 原标题：Gemini 3.1 Flash TTS: the next generation of expressive AI speech

- 来源：Google DeepMind
- 发布时间：2026-04-15T16:03:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/zbhfd7bca98fc4pjzh9xc7njx
- 原文：https://deepmind.google/blog/gemini-3-1-flash-tts-the-next-generation-of-expressive-ai-speech/

## 摘要

Google DeepMind 发布 Gemini 3.1 Flash TTS，一款主打可控性与表现力的文本转语音模型，已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

## 推荐理由

原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口，可据此判断语音生成的可控性变化。

## 锐评

Gemini 3.1 Flash TTS 的卖点不是音质，是把语音生成变成可编程的导演台——用自然语言标签控制语速、语气、口音，还能多角色对话。Artificial Analysis 盲测 Elo 1,211，被放进高质低价象限，说明它主打便宜好用，不是最像人。

但 Elo 1,211 只说明人类偏好排名，不说明延迟和并发成本。正文没披露定价和每秒延迟，这两项才是开发者真正要算的账。音频标签这套控制方式，ElevenLabs 早就在做，Google 的差异是塞进 Vertex AI 和 Workspace，卖的是分发，不是新能力。
