# 微软开源语音模型 VibeVoice-ASR 实测：一小时播客 8 分 45 秒转完，但 32GB 内存的 Mac 跑不动

> 原标题：微软 1 月开源的 VibeVoice-ASR 语音识别模型（https://t.co/CsXftlEAul），Simon Willison 在 Mac 上测试后给出了一份具体的实测报告。

- 来源：X · @dotey（宝玉）
- 发布时间：2026-04-29T00:06:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11272
- 原文：https://x.com/dotey/status/2049279099454292283

## 摘要

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR，模型大小 5.71GB。转写一小时播客用了 8 分 45 秒，prefill 阶段内存峰值冲到 61.5GB，生成阶段稳定在 18GB 左右，所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

## 推荐理由

这篇不是新模型发布，而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍，给出了速度和内存的实测数字。我会先打个折：这只是单次测试，不代表所有场景，但 61.5GB 的内存峰值确实把 32GB 笔电劝退了，这点对想本地部署的人很关键。正文没提准确率对比，所以别当全面评测看，就当一份硬件门槛参考。

## 锐评

Simon Willison 在 128GB 内存的 M5 Max 上实测了 VibeVoice-ASR 的 4-bit 量化版，一小时播客转写用时 8 分 45 秒。这个速度不算快，但核心价值在于把传统“Whisper + 说话人分离工具”的多步流程压缩成一次推理，直接输出谁在什么时候说了什么。模型是 MIT 协议开源的，9B 参数，原生支持 50 多种语言和中英混说，单次最多处理 60 分钟音频。

内存是硬门槛。prefill 阶段峰值冲到 61.5GB，生成阶段稳定在 18GB 左右，所以 32GB 笔电基本没戏，想本地跑至少 64GB 以上。另外有个有意思的细节：模型把一场两人对谈识别成了三个说话人，因为主持人的开场白和广告口播用了不同录音环境，模型直接按声学特征切出了第三人。这说明说话人分离的准确度还受录音条件影响，不是真的人数识别。

正文没披露字错率或多语种混说的具体准确率数据，也没跟 Whisper 做横向对比。超过 60 分钟的音频需要自己切片，还得手动对齐切片间的说话人 ID，这块的工程成本不能忽略。对做播客转写、会议纪要的人来说，流程确实简化了，但内存门槛和长音频处理的后处理工作，让这个方案目前更适合有高配机器的开发者先试试看。
