有人把英伟达 Parakeet 语音转文字模型移植到了 ggml,不再需要 Python,还能量化压缩
I ported NVIDIA Parakeet (speech-to-text) to ggml: same output as NeMo, faster, GGUF-quantized, no Python
开发者 mudler_it 把英伟达的 Parakeet 语音转文字模型用 C++ 和 ggml 重写了一遍,彻底甩掉了 Python 和 PyTorch。他测试下来,在 f32 和 f16 精度下输出结果和原版 NeMo 逐字节一致,但速度更快,大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化,提供了 f1...
推荐理由:我会先打个折:这是个人移植项目,不是 NVIDIA 官方出品,长期维护和后续模型支持还得看社区。但亮点很明确——输出字节级对齐 NeMo,量化后跑得更快,而且不用碰 Python 环境。对想在树莓派、本地服务器或离线场景跑语音转文字的人来说,这是个省事的选择。正文没披露量化后的精度损失有多大,这点先别太激动。整体看,技术验证扎实,痛点打得准,放在 featured 低位合适。