# 网易有道把“子曰4”的多模态模型和语音合成模型都开源了

> 原标题：网易有道"子曰4"多模态模型、语音合成模型全量开源

- 来源：AI HOT 精选
- 发布时间：2026-05-22T09:45:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25615
- 原文：https://www.ithome.com/0/954/124.htm

## 摘要

这次开源的是一个270亿参数的多模态模型和一个语音合成模型。多模态模型主要针对教育场景，能看懂带图表的数学题，在纯中文数理难题上准确率81.4%。团队用精简过的推理样本做训练，把模型思考过程的输出长度压缩了43.2%，所以回答同样的问题，吐出的token更少、推理更快，直接效果就是推理成本会降下来。语音合成模型支持用3秒中文音频克隆音色，能跨14种语言...

## 推荐理由

我会先打个折：有道不是前沿大模型实验室，所以这条消息的份量到不了顶流，但信息本身够具体。27B 参数的多模态模型，中文数理题做到 81.4% 准确率，说明在中文理科场景有一定可用性，不过正文没披露评测集和对比基线，这点先别太激动。语音模型覆盖 14 种语言，对做多语言 TTS 产品的人是个直接可用的资源。全量开源意味着可以直接拿来微调或部署，省去从头训的成本，但实际推理开销和显存需求正文没提，动手前得自己测一下。整体看，这是一次信息完整、可验证的发布，对关注中文多模态和语音落地的从业者有实操参考价值。

## 锐评

网易有道这次把“子曰4”的两个核心模型全量开源，对做教育场景和语音应用的开发者来说，是个可以直接上手试试的东西。多模态模型有270亿参数，主打能看懂带图表的数学题，在纯中文数理难题上准确率81.4%。这个数字看着不错，但正文没说明是在哪个基准测试集上跑的，也没提对比的是哪些同等规模的模型，所以这个“行业顶尖”的说法得先打个折。

比较实在的一个点是，团队用精简过的推理样本做训练，把模型思考过程的输出长度压缩了43.2%。这意味着回答同一个问题，吐出的token更少，推理成本会直接降下来，对实际部署来说比跑分更有意义。语音合成模型支持用3秒中文音频克隆音色，能跨14种语言合成，克隆准确度号称超97%，但相似度是85%以上，这个差距说明在情感和跨语言迁移上，实际听感可能还有提升空间。

整体看，这次开源诚意挺足，模型权重和代码都给了。但缺的是更多第三方评测和实际业务场景里的延迟、并发数据，光看官方给出的几个数字，还判断不了在真实高并发教育场景下到底省不省钱、好不好用。
