Sumi:从头训练的 7B 开源均匀扩散语言模型
Sumi:从头训练的7B开源均匀扩散语言模型
Sumi 是第一个从零开始、用 1.5 万亿 token 预训练出来的 7B 参数均匀扩散语言模型。均匀扩散的意思是,模型在生成文本时每一步都可以修改任意位置的词,不像传统模型只能从左往右写,理论上更灵活。团队把模型权重、训练检查点和完整配方全公开了,包括用了哪些公开数据集、怎么混合的。在知识、推理和代码评测上,Sumi 跟同等训练量的自回归模型打得有...
推荐理由:Sumi是第一个从零预训练出来的7B均匀扩散语言模型,用了1.5万亿token,生成时能在任意位置改词,不像自回归模型只能从左往右写。团队把权重、训练检查点和完整配方都公开了,在知识、推理和代码评测上跟同等训练量的自回归模型打得有来有回。这点先别太激动——正文没披露推理速度和实际部署成本,扩散模型在落地时往往比自回归慢不少。不过敢在主流路线之外砸资源从头训一个7B模型,还把家底全亮出来,本身就值得关注。