# Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

> 原标题：Speaking of Voxtral

- 来源：Mistral AI
- 发布时间：2026-03-23T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/ol4jc386djmpvs590zennn5g9
- 原文：https://mistral.ai/news/voxtral-tts/

## 摘要

Mistral AI 发布首个文本转语音模型 Voxtral TTS，4B 参数，支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言，具备情感表达与零样本跨语言音色适配能力。

## 推荐理由

原文给出 4B 参数、9 种语言、70ms 延迟与定价，读者可据此判断企业语音智能体的成本与选型空间。

## 锐评

Mistral 这次把语音合成压到 4B 参数、70ms 首包延迟、$0.016/千字符，明显是冲着企业语音智能体的成本账去的。它敢直接对标 ElevenLabs Flash v2.5，说自然度更好、延迟相当，但评测是自家找 3 个标注员做的偏好测试，样本和任务都没公开，我会先打个折。3 秒参考音频就能克隆音色、9 种语言零样本跨语适配，这两点如果真稳，做客服和翻译链路确实省事。不过 70ms 是 10 秒音频、500 字符的典型输入，长文本靠 API 拼接，实际端到端延迟还得看工程。
