# 有人租了 21 款 GPU 跑同一个 5GB 显存的小 TTS 模型，实测速度差距

> 原标题：21 GPU's benchmarked running a small TTS model (vram peak: 5GB)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-18T21:46:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22547
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1th2f5w/21_gpus_benchmarked_running_a_small_tts_model/

## 摘要

一位 Reddit 用户为了测 OmniVoice 这个小 TTS 模型，在 vast.ai 上租了 21 款不同的 GPU。模型跑起来显存峰值大概 5GB，不算大。测试用 xRT 作为音频生成速度的指标，每张卡都跑了 3 次带参考音频的声音克隆取平均。正文没披露具体哪张卡最快、速度差多少倍，也没给价格和性价比对比，所以只能看出有人在认真做横向实测，但...

## 推荐理由

一个 Reddit 用户用 vast.ai 租了 21 款 GPU，跑 OmniVoice 这个小体量 TTS 模型，峰值显存才 5GB，每次测试跑 3 遍取平均 xRT。我会先打个折：这是个人在云租用环境下的非严格基准，不是实验室受控测试，但胜在真实、直接，能帮想自己部署语音合成的人快速筛显卡。正文没披露具体 xRT 数值表，只给了结论性对比，这点先别太激动。整体信息量对本地推理圈子有用，但范围偏窄，所以放在低 featured 档。

## 锐评

这条帖子最有价值的地方是它真的动手跑了，不是纸上谈兵。作者在 vast.ai 上租了 21 款 GPU，用 OmniVoice 这个小 TTS 模型做声音克隆，每张卡跑 3 次取平均，用 xRT 衡量音频生成速度。模型显存峰值约 5GB，门槛不高，理论上很多消费级卡也能跑。

但正文被 Reddit 的网络安全拦截了，我们看不到具体数据。哪张卡最快、速度差几倍、每张卡租用价格是多少、性价比怎么排，这些关键信息都没披露。所以这条新闻只能说明有人在认真做横向对比，实际结论得等原帖恢复或者作者补发。

我会先打个折：如果后续数据放出来，对想自建 TTS 服务的人会是个很实用的参考，尤其是显存要求低意味着省钱。现在缺的就是那张对比表和价格，没这些就只能当个动手精神的案例看。
