跳到正文
Hacker News 首页

Linum 把生图模型训练速度提了 3.6 倍,同时把分辨率翻了 4 倍

Training Text-to-Image Models 3.6× Faster

Linum 搞了个叫 JiT-DDT 的新架构,把原本分开训练的 VAE(图像压缩器)和 DiT(扩散生成器)合并成一个直接在像素空间工作的模型。相比他们上一版 Linum v2,新模型训练省了 3.6 倍的 GPU 时间,但生成的图从 256×256 提到了 512×512。核心思路是用更狠的 32×32 倍压缩来砍掉注意力窗口的 token 数,再...

读原文 ↗导出 Markdown