# Miso One 开源了一个 8B 参数的语音模型，克隆声音只需一小段样本，延迟 110 毫秒

> 原标题：Miso One 开源语音模型：8B 参数、110ms 延迟、一次语音克隆

- 来源：AI HOT 精选
- 发布时间：2026-06-03T16:32:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33637
- 原文：https://x.com/kimmonismus/status/2062210845308780639

## 摘要

Miso One 放出了一个 8B 参数的开源 TTS 模型，主打一次语音克隆——给它一小段音频样本就能模仿那个人的说话风格和节奏。推理延迟标称 110ms，对实时对话场景算可用。模型权重直接挂在 GitHub 上，你可以自己部署，音频数据不用上传到第三方服务器。官方说 API 之后会出，但正文没提价格和上线时间。

## 推荐理由

我会先打个折：这是单条推文来源的发布，没有跑分对比、没写许可证细节、也没有第三方复现结果。但8B参数、110ms延迟、能自托管的一次语音克隆这几个事实本身够硬，放在featured刚好，再往上就缺验证了。

## 锐评

Miso One 放出了一个 8B 参数的开源语音合成模型，核心卖点是给一小段音频就能模仿说话风格，推理延迟标称 110 毫秒，对实时对话场景勉强够用。模型权重直接挂在 GitHub 上，音频不用上传第三方，这对在意数据隐私的团队是个加分项。

不过正文只说了这些，没披露克隆质量的具体指标，比如相似度评分、在不同口音或噪音下的表现。也没提中文支持情况，如果主要面向英文场景，国内开发者得自己调。官方说 API 之后会出，但价格和上线时间都没给，想直接接服务的人还得等。

我会先打个折：开源自部署是好事，但 8B 参数跑在本地对硬件有要求，110ms 延迟是在什么设备上测的也没说。想用在实时对话里，最好自己拿目标场景压测一下。
