# 南大和阿里发现 DiT 里的残差流拖慢收敛，改用跨层路由后训练快了近 9 倍

> 原标题：近9倍训练加速：DiT里的残差流，正在成为收敛瓶颈

- 来源：阿里技术 · 公众号
- 发布时间：2026-05-26T10:50:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31556
- 原文：https://mp.weixin.qq.com/s?__biz=Mzg4NTczNzg2OA==&mid=2247509566&idx=1&sn=ace75be905d15523692f57dcd02142a4

## 摘要

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法，把 DiT 模型里固定的残差累积，换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试，FID 从 9.67 降到了 7.56，而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截，具体怎么实现路由、...

## 推荐理由

我会先打个折：这还是一个针对DiT架构的训练方法改进，不是新模型或产品发布，所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈，然后用一个时间感知的路由去替代固定累加，效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人，这个省钱省时间的信号够强，featured没问题。

## 锐评

这条研究把 DiT 模型里一直默认的残差累积方式给改了。原来不管生成到哪一步，信息都走固定路径，DAR 的做法是让模型根据当前时间步自己选跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试，FID 从 9.67 降到 7.56，而且达到原来同等收敛质量只需要约九分之一的训练步数，加速接近 9 倍。这个数字如果属实，对训图模型的人来说省的不是一点半点。

但这里有个硬伤：原文因为微信环境验证拦截，正文完全没加载出来。路由机制具体怎么设计、跨层选择会不会引入额外计算开销、推理时延迟涨了多少、在其他尺寸模型或更高分辨率上是否成立，这些关键信息全部缺失。FID 降了是好事，但只看一个指标、一个模型尺寸，结论还撑不起“残差流是收敛瓶颈”这个标题。

我会先打个折。等论文公开后，重点要看路由模块本身的计算量和参数量，以及推理阶段的吞吐变化。如果路由开销很小，那这条思路确实值得跟；如果只是把训练成本转嫁到推理上，实用性就大打折扣了。
