# Sumi：从头训练的 7B 开源均匀扩散语言模型

> 原标题：Sumi：从头训练的7B开源均匀扩散语言模型

- 来源：AI HOT 精选
- 发布时间：2026-06-17T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39008
- 原文：https://arxiv.org/abs/2606.19005

## 摘要

Sumi 是第一个从零开始、用 1.5 万亿 token 预训练出来的 7B 参数均匀扩散语言模型。均匀扩散的意思是，模型在生成文本时每一步都可以修改任意位置的词，不像传统模型只能从左往右写，理论上更灵活。团队把模型权重、训练检查点和完整配方全公开了，包括用了哪些公开数据集、怎么混合的。在知识、推理和代码评测上，Sumi 跟同等训练量的自回归模型打得有...

## 推荐理由

Sumi是第一个从零预训练出来的7B均匀扩散语言模型，用了1.5万亿token，生成时能在任意位置改词，不像自回归模型只能从左往右写。团队把权重、训练检查点和完整配方都公开了，在知识、推理和代码评测上跟同等训练量的自回归模型打得有来有回。这点先别太激动——正文没披露推理速度和实际部署成本，扩散模型在落地时往往比自回归慢不少。不过敢在主流路线之外砸资源从头训一个7B模型，还把家底全亮出来，本身就值得关注。

## 锐评

Sumi 这次放出来的东西挺实在：一个用 1.5 万亿 token 从零开始预训练的 7B 均匀扩散语言模型，权重、训练检查点、完整配方全公开。均匀扩散的意思是，模型生成文本时每一步都能回头改任意位置的词，不像现在主流的自回归模型只能从左往右写，理论上更灵活。在此之前，自回归和掩码扩散都有大尺寸的开源模型供社区研究，唯独均匀扩散这块是空白，Sumi 算是把坑填上了。

看成绩单，它在知识、推理和代码评测上跟同等训练量的自回归模型打得有来有回，但一到常识推理就明显掉队。团队自己分析，很可能是训练数据里教材、学术内容占比太高，生活化语料不够。这点先别太激动——论文没给出具体的推理速度对比，也没说生成时的延迟和成本比自回归模型高多少，这些在实际落地时才是关键。

现在还缺什么？一是没看到它在多轮对话、指令遵循这类实际应用场景下的表现；二是均匀扩散的生成可控性到底比自回归强在哪，论文只给了基准分，没做深入的案例拆解。不过作为一个干净的参考基线，Sumi 的开源对想研究扩散模型缩放规律和生成机制的人来说，是个不错的起点。
