# Wispr 发布实时语音模型 Canto：在真实口述场景下错误率最低，但别急着拿公开基准分说事

> 原标题：Canto: A speech model built for the real world

- 来源：Hacker News 首页
- 发布时间：2026-09-17T18:32:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57164
- 原文：https://wisprflow.ai/canto

## 摘要

Wispr 推出了一个叫 Canto 的实时语音识别模型，主打真实世界的口述场景。他们在 10 小时、超过 2300 名用户的真实录音上做了测试，Canto 的词错误率（WER）比 Google、OpenAI、AssemblyAI 和 Deepgram 的模型都低。在一个专门挑刺的 3 小时挑战集里（包含噪音、低音量、短句），Canto 在实时模型里排...

## 推荐理由

这篇值得上推荐，主要是因为它在真实脏数据上做了横向对比，不是实验室自嗨。H 和 K 都站得住：场景够脏、对比够直接，对做语音产品的同行有参考意义。但我会先打个折——Wispr 不是头部玩家，这更像一次产品性能秀，不是行业级事件，所以 R 不成立，分数卡在 featured 门槛上。再往上就得看有没有开源、有没有第三方复现了，正文没提这些。

## 锐评

Wispr 发布了一个叫 Canto 的实时语音识别模型，专门针对日常口述场景，比如在嘈杂办公室、通勤路上用笔记本麦克风或耳机说话。他们在 10 小时、超过 2300 名用户的真实录音上做了测试，Canto 的词错误率（WER）比 Google、OpenAI、AssemblyAI 和 Deepgram 的模型都低。在一个专门挑刺的 3 小时挑战集里（包含噪音、低音量、短句），Canto 在实时模型里排第一，但输给了 Gemini 3.1 Pro——一个不适合低延迟场景的大模型。

这个结果有参考价值，但得打个折。首先，10 小时的测试集不算大，而且所有样本都来自 Wispr 自家用户，虽然做了说话人隔离，但数据分布可能更偏向 Canto 的训练域。其次，正文没披露对比的其他模型具体是哪个版本，也没说推理延迟和成本，这对实时模型来说很关键。在公开基准上，Canto 在 LibriSpeech 上并列第一，但在 FLEURS 和 Common Voice 上没领先，作者自己也说那些数据集主要是朗读语音，跟真实口述不一样。

还缺什么？缺第三方独立评测，缺延迟和资源消耗数据，也缺多语种和方言的表现。如果这些能补上，Canto 在真实场景下的优势才更有说服力。
