Cartesia 发了两个实时语音模型 Sonic 3.5 和 Ink 2,一个说一个听,双双在榜单上排第一
Cartesia 发布 Sonic 3.5 与 Ink 2 实时语音模型
Cartesia 把文字转语音的 Sonic 3.5 和语音转文字的 Ink 2 打包成一个实时语音栈。Sonic 3.5 从收到文字到出声音只要约 82 毫秒,在实时 TTS 榜单上拿了第一;Ink 2 在 Artificial Analysis 的流式语音转文字榜单上也排第一。Cartesia 现在是唯一一家同时占着听和说两个榜首的厂商。正文没提模...
推荐理由:Cartesia 把听和说两个方向都做到实时榜单第一,82 毫秒的出声延迟是个硬指标,说明在需要低延迟的对话场景里有实际优势。不过语音赛道本身关注度有限,正文也没披露模型参数量、训练数据和具体架构,技术细节还看不到,所以分数卡在 85 以下。