NVIDIA 开源 NemotronLabs VoiceChat 11B:一个模型搞定语音对话,抢话延迟约 450 毫秒,还能边聊边调工具
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用
NVIDIA 把 NemotronLabs VoiceChat 11B 的权重和代码都公开了。这是一个 110 亿参数、端到端的语音模型,不再走传统的“语音识别转文字、大模型思考、文字转语音”流水线,而是把听和说塞进同一个网络里流式处理。实测抢话反应延迟是 448 毫秒,基本跟人对话的节奏差不多。它支持全双工,也就是双方可以同时说话、随时打断,模型能实...
推荐理由:NVIDIA 这次把 NemotronLabs VoiceChat 11B 完整开源,448 毫秒的打断反应时间和全双工能力是硬指标,不是刷榜。但原文像产品发布稿,没有第三方对比测试,也没说清楚工具调用在嘈杂环境下的成功率。我会先打个折:技术方向对,实际落地效果还得等社区跑完分再看。