Wispr 发布实时语音模型 Canto:在真实口述场景下错误率最低,但别急着拿公开基准分说事
Canto: A speech model built for the real world
Wispr 推出了一个叫 Canto 的实时语音识别模型,主打真实世界的口述场景。他们在 10 小时、超过 2300 名用户的真实录音上做了测试,Canto 的词错误率(WER)比 Google、OpenAI、AssemblyAI 和 Deepgram 的模型都低。在一个专门挑刺的 3 小时挑战集里(包含噪音、低音量、短句),Canto 在实时模型里排...
推荐理由:这篇值得上推荐,主要是因为它在真实脏数据上做了横向对比,不是实验室自嗨。H 和 K 都站得住:场景够脏、对比够直接,对做语音产品的同行有参考意义。但我会先打个折——Wispr 不是头部玩家,这更像一次产品性能秀,不是行业级事件,所以 R 不成立,分数卡在 featured 门槛上。再往上就得看有没有开源、有没有第三方复现了,正文没提这些。