# 有人把英伟达 Parakeet 语音转文字模型移植到了 ggml，不再需要 Python，还能量化压缩

> 原标题：I ported NVIDIA Parakeet (speech-to-text) to ggml: same output as NeMo, faster, GGUF-quantized, no Python

- 来源：r/LocalLLaMA
- 发布时间：2026-05-31T20:35:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30821
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tt6oja/i_ported_nvidia_parakeet_speechtotext_to_ggml/

## 摘要

开发者 mudler_it 把英伟达的 Parakeet 语音转文字模型用 C++ 和 ggml 重写了一遍，彻底甩掉了 Python 和 PyTorch。他测试下来，在 f32 和 f16 精度下输出结果和原版 NeMo 逐字节一致，但速度更快，大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化，提供了 f1...

## 推荐理由

我会先打个折：这是个人移植项目，不是 NVIDIA 官方出品，长期维护和后续模型支持还得看社区。但亮点很明确——输出字节级对齐 NeMo，量化后跑得更快，而且不用碰 Python 环境。对想在树莓派、本地服务器或离线场景跑语音转文字的人来说，这是个省事的选择。正文没披露量化后的精度损失有多大，这点先别太激动。整体看，技术验证扎实，痛点打得准，放在 featured 低位合适。

## 锐评

这条消息对想在本地或自有服务器上跑语音转文字的人来说是个实打实的好消息。开发者 mudler_it 把英伟达的 Parakeet 模型移植到了 ggml 框架上，用 C++ 重写，彻底告别了 Python 和 PyTorch 那套重型依赖。他测试的结果是，在 f32 和 f16 精度下，输出结果和原版 NeMo 能做到逐字节一致，但速度更快，大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化，提供了从 f16 到 q4_k 多种精度，意味着你可以根据硬件显存大小自己选，低配机器也能跑。

不过得先打个折。这条信息来自 Reddit 用户自述，正文因为网络限制没抓到完整内容，我们看不到具体的测试环境、硬件配置和延迟数据。5 倍加速是在什么显卡上跑的、对比的基线是什么版本，这些关键细节都缺失。另外，Parakeet 本身是英伟达的模型，这个移植版是社区行为，后续能不能跟上官方更新、有没有人长期维护，都是未知数。如果你打算用在生产环境，建议先拿自己的音频样本跑一遍，重点对比准确率和资源占用，别只看加速倍数就上头。
