# Zyphra 开源 ZONOS2：8B 总参数、推理只激活 9 亿的实时语音合成模型，支持零样本声音克隆

> 原标题：ZONOS2: real-time TTS with 8B params, 900M active, and high-fidelity voice cloning

- 来源：r/LocalLLaMA
- 发布时间：2026-06-13T08:33:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38035
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u4lk5c/zonos2_realtime_tts_with_8b_params_900m_active/

## 摘要

Zyphra 放出了 ZONOS2，一个实时文字转语音模型，权重用 Apache 2.0 协议开源。模型总参数量 8B，但推理时只激活 900M 参数，靠的是稀疏 MoE 架构，在速度和表现力之间找了个平衡。主打功能是零样本声音克隆，给一段参考音频就能模仿说话人的音色和风格，不需要额外微调。文本处理上它不依赖音素转换器，直接读 UTF-8 原始字节，对...

## 推荐理由

Zyphra 这次放出的 ZONOS2 是个实时 TTS，8B 参数但推理只激活 900M，靠稀疏 MoE 在速度和表现力之间找了个平衡点。主打零样本声音克隆，给段参考音频就能模仿音色和风格，不用额外微调。文本处理上不走音素转换的老路，直接读 UTF-8 原始字节，省了一步。权重用 Apache 2.0 协议开源，本地能跑，这点对社区很友好。不过目前只有 Reddit 帖子，没有独立评测或横向对比，实际克隆效果和稳定性还得等更多验证，所以分数先定在 74。

## 锐评

ZONOS2 最值得看的是它用稀疏 MoE 把 8B 总参数压到推理时只跑 900M，这思路在 TTS 里还不多见，等于拿大模型容量换小模型速度，同时尽量保住声音表现力。零样本声音克隆是核心卖点，给一段参考音频就能模仿说话人，不用额外微调。文本处理直接读 UTF-8 原始字节，跳过了音素转换器，对中文、韩文、日文和句中混说多语言更友好。音频走 44.1kHz 的 Descript Audio Codec，目标是录音室级别输出，但高采样率也意味着建模难度更大，Zyphra 说靠把训练数据从 20 万小时堆到 600 万小时以上来补这个差距。

在 TTSDS 韵律评分上它拿了 88.7，比 Qwen 3 TTS、Cartesia Sonic 3.5 和 ElevenLabs V3 都高，不过这个榜是 Zyphra 自己发布的 ZTTS1-Eval 基准跑的，公信力还得等第三方复现。另外，正文没披露实时推理的具体延迟数字，也没说 900M 激活参数在消费级显卡上跑不跑得动，这两点对本地部署的人很关键。

整体看，开源、可商用、声音克隆强，这几个点组合起来挺有吸引力。但别急着下结论，等社区把延迟、显存占用和跨语言克隆的稳定性测出来再说。
