# 面壁智能、OpenBMB 和清华放出一个 2B 开源语音模型 VoxCPM 2，能说 9 种方言、30 种外语，还复刻了郭德纲的《莽撞人》贯口

> 原标题：国产免费2B开源语音模型征服《莽撞人》！复刻郭德纲最难贯口

- 来源：量子位 · 公众号
- 发布时间：2026-04-08T04:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6252
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247881487&idx=1&sn=faf399aa06b8fb64a89ef3d9a2de297d

## 摘要

VoxCPM 2 是个 20 亿参数的开源语音模型，主打低延迟和少样本复刻。官方说生成经常在 1 秒内完成，给一段 5 秒以上的参考音频就能模仿音色和风格，演示里用它念了语速极快的相声贯口《莽撞人》。技术上它没用传统的声学码本，而是走扩散自回归连续表征路线，支持去噪、LoRA 微调和全量微调。正文没披露具体的训练数据规模和硬件需求，也没给标准化的语音质...

## 推荐理由

面壁智能和清华 OpenBMB 放出的 VoxCPM 2 是一个 2B 开源语音模型，不是薄 demo。正文列了可复现条件：48kHz、9 种方言、30 种外语、≥5 秒参考音频、1 秒内生成，还支持降噪和 LoRA/全参微调。技术路线上走了 tokenizer-free 的扩散自回归连续表征，这点比模型尺寸更值得看。我会先打个折：正文没披露方言和外语的具体测试集与客观指标，也没给端侧实测延迟和内存占用，所以实际部署成本还要自己测。但整体信息量够，对盯中文开源语音栈的人有参考价值。

## 锐评

VoxCPM 2 是个 20 亿参数的开源语音模型，走了一条不太一样的路：它没用传统的声学码本，而是直接处理连续声音信号，靠扩散自回归来生成。官方说生成经常在 1 秒内完成，给一段 5 秒以上的参考音频就能模仿音色和风格，演示里用它念了语速极快的相声贯口《莽撞人》，听起来确实能跟上节奏。技术上支持去噪、LoRA 微调和全量微调，对想自己调声音的开发者比较友好。

不过正文没披露具体的训练数据规模和硬件需求，也没给标准化的语音质量评测分数。贯口演示虽然抓耳，但只能说明它在特定高语速场景下没崩，日常对话、多轮交互、嘈杂环境下的表现还不清楚。另外，少样本复刻的稳定性、不同参考音频长度对效果的影响，这些关键细节也都没展开。想在生产环境用的话，建议先拿自己的场景跑一遍，别只看相声 demo 就下单。
