网易有道把“子曰4”的多模态模型和语音合成模型都开源了
网易有道"子曰4"多模态模型、语音合成模型全量开源
这次开源的是一个270亿参数的多模态模型和一个语音合成模型。多模态模型主要针对教育场景,能看懂带图表的数学题,在纯中文数理难题上准确率81.4%。团队用精简过的推理样本做训练,把模型思考过程的输出长度压缩了43.2%,所以回答同样的问题,吐出的token更少、推理更快,直接效果就是推理成本会降下来。语音合成模型支持用3秒中文音频克隆音色,能跨14种语言...
推荐理由:我会先打个折:有道不是前沿大模型实验室,所以这条消息的份量到不了顶流,但信息本身够具体。27B 参数的多模态模型,中文数理题做到 81.4% 准确率,说明在中文理科场景有一定可用性,不过正文没披露评测集和对比基线,这点先别太激动。语音模型覆盖 14 种语言,对做多语言 TTS 产品的人是个直接可用的资源。全量开源意味着可以直接拿来微调或部署,省去从头训的成本,但实际推理开销和显存需求正文没提,动手前得自己测一下。整体看,这是一次信息完整、可验证的发布,对关注中文多模态和语音落地的从业者有实操参考价值。