# RedNote 开源 dots.tts：一个 20 亿参数的语音合成模型，支持 48kHz 和零样本声音克隆

> 原标题：dots.tts 2B🎙️ SOTA TTS from RedNote

- 来源：r/LocalLLaMA
- 发布时间：2026-06-05T20:21:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34686
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1txwbge/dotstts_2b_sota_tts_from_rednote/

## 摘要

RedNote 放出了一个叫 dots.tts 的语音合成模型，参数量 20 亿，用 Apache 2.0 协议开源。它走的是全连续架构，文字直接映射到语音，跳过了传统的音素流水线，合成采样率能到 48kHz。零样本声音克隆也支持，给一段参考音频就能模仿说话。不过 Reddit 原帖被屏蔽了，正文没披露训练数据、推理延迟和实际合成效果的具体指标，这点先...

## 推荐理由

HKR 三项都过了，但得先打个折：信息源是 Reddit 摘要，原帖还被屏蔽了，SOTA 的说法没给出具体基准名称或分数。Apache 2.0、20 亿参数、48kHz 和无音素流水线这些点够硬，给个低位的 featured 没问题。正文没披露训练数据、推理延迟和实际合成效果，这些缺口让判断得收着点。

## 锐评

dots.tts 把文字直接映射到语音，省掉了传统 TTS 里先转音素再合成的中间步骤，架构上更简洁。20 亿参数在语音模型里算大块头，支持 48kHz 采样率和零样本声音克隆，给段参考音频就能模仿说话，Apache 2.0 协议商用也友好。

但 Reddit 原帖被屏蔽了，我们只能看到标题和摘要，正文没披露训练数据来源、推理延迟、显存占用和合成质量的客观指标。没有这些，光说“SOTA”说服力不够。零样本克隆的相似度、长文本稳定性、多语言支持情况也一概不知。

我会先打个折：架构思路有看点，但实际能不能用、好不好用，得等模型权重放出来跑过才知道。如果 RedNote 后续补上技术报告和评测，这条才值得认真跟。
