# 微软 VibeVoice 语音合成与长音频转写被移植到纯 C++，推理不再需要 Python

> 原标题：vibevoice.cpp: Microsoft VibeVoice (TTS + long-form ASR with diarization) ported to ggml/C++, runs on CPU/CUDA/Metal/Vulkan, no Python at inference

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T07:33:15.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14392
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t48fkt/vibevoicecpp_microsoft_vibevoice_tts_longform_asr/

## 摘要

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本，叫 vibevoice.cpp，支持 CPU、CUDA、Metal 和 Vulkan 推理，不用装 Python 环境。语音合成这边，给一段 30 秒的参考录音就能克隆声音，输出 24kHz 的语音。语音识别部分用的是一个 7B 模型，能处理长音频并区分不同说话人，结...

## 推荐理由

这条更新对做本地音频部署的人有用，给出了具体的运行数字和限制。我会先打个折：它来自社区移植，不是微软官方动作，而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理，不值得当天必写，但值得放进雷达。

## 锐评

这条消息对想在本地跑语音克隆和长音频转写的人挺实用。LocalAI 把微软的 VibeVoice 用 ggml 重写成 C++ 版本，叫 vibevoice.cpp，支持 CPU、CUDA、Metal 和 Vulkan，推理时不用装 Python 环境。语音合成这边，给一段 30 秒的参考录音就能克隆声音，输出 24kHz 的语音。语音识别部分用的是一个 7B 模型，能处理长音频并区分不同说话人，输出带说话人标签的 JSON。

但有个硬伤：内存占用很高。正文提到用 Q8_0 量化跑 17 分钟音频，峰值内存接近 26GB。这个数字说明普通消费级显卡或 16GB 内存的机器基本跑不动长音频，只能处理很短片段。另外目前还不支持流式输出，你得等整段音频处理完才能拿到结果，实时场景就别想了。

正文没披露语音克隆的相似度有多高，也没说 ASR 在不同噪音环境下的准确率。这两个指标直接决定能不能用，建议等第三方实测再判断。
