# Nari Labs 把 Qwen3-TTS 的首音延迟压到 50 毫秒以内，一张 H100 就能跑 10 并发

> 原标题：How We Made a Text-to-Speech Model Respond in Sub-50 ms

- 来源：Hacker News 首页
- 发布时间：2026-08-21T15:51:10.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52064
- 原文：https://nari-labs.com/blog/qwen3-tts-speed-cost-frontier/

## 摘要

Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案，在一张 H100 上做到 10 并发请求时，95% 的用户听到第一个字的时间不超过 50 毫秒，且播放不卡顿。他们对比了 vLLM-Omni、SGLang-Omni 等四个引擎，默认设置下最快的 p95 首音延迟也要 277 毫秒。核心优化有两招：一是动态切掉模型开头几十毫秒的静...

## 推荐理由

Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案，单张 H100 跑 10 个并发请求，95% 的用户在 50 毫秒内就能听到第一个字，比 vLLM-Omni 等引擎默认配置快了五倍以上。文章给了具体 benchmark 和可复现的优化步骤，我会先打个折——这是他们自己测的数据，实际场景里网络抖动和客户端解码还会吃掉一点延迟，但核心思路（动态剪掉开头静音、用 CUDA Graph 合并小算子）确实能帮做实时语音的团队少踩很多坑。
