# NVIDIA 开源 NemotronLabs VoiceChat 11B：一个模型搞定语音对话，抢话延迟约 450 毫秒，还能边聊边调工具

> 原标题：NVIDIA 发布 NemotronLabs VoiceChat 11B：开源全双工语音模型，支持约 450 毫秒轮换与实时工具调用

- 来源：AI HOT 精选
- 发布时间：2026-08-09T23:58:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49682
- 原文：https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling

## 摘要

NVIDIA 把 NemotronLabs VoiceChat 11B 的权重和代码都公开了。这是一个 110 亿参数、端到端的语音模型，不再走传统的“语音识别转文字、大模型思考、文字转语音”流水线，而是把听和说塞进同一个网络里流式处理。实测抢话反应延迟是 448 毫秒，基本跟人对话的节奏差不多。它支持全双工，也就是双方可以同时说话、随时打断，模型能实...

## 推荐理由

NVIDIA 这次把 NemotronLabs VoiceChat 11B 完整开源，448 毫秒的打断反应时间和全双工能力是硬指标，不是刷榜。但原文像产品发布稿，没有第三方对比测试，也没说清楚工具调用在嘈杂环境下的成功率。我会先打个折：技术方向对，实际落地效果还得等社区跑完分再看。

## 锐评

这条消息最值得看的是架构简化。传统语音助手走 ASR-LLM-TTS 三步流水线，每一步都有延迟，打断体验很僵硬。NemotronLabs VoiceChat 11B 把听和说塞进同一个网络里流式处理，实测抢话反应延迟 448 毫秒，跟人对话的节奏差不多。它还支持对话中实时调用工具，比如查天气、订票，不用等一轮对话结束再动手。

不过要打个折：448 毫秒是在什么硬件、什么网络条件下测的，正文没披露。11B 参数对端侧部署来说不算轻，手机或嵌入式设备能不能跑得动、功耗多少，也没提。另外，全双工意味着双方可以同时说话，模型在嘈杂环境下的误打断率和漏打断率，文章同样没给数字。

开源权重和代码是好事，但实际能落地的场景还缺一份硬件基准和噪声鲁棒性报告。如果你打算拿它做实时语音产品，建议先在自己的目标设备上跑一下延迟和打断准确率，别只看纸面数字。
