# 字节提出 GRN，让生图模型像人一样边画边改，不再死磕扩散和自回归

> 原标题：挑战扩散自回归统治！字节提出视觉生成第三种路线，让模型像人类一样边画边改

- 来源：量子位 · 公众号
- 发布时间：2026-05-13T10:06:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20776
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247890479&idx=1&sn=b266ed272248b79a32d1be46c1e01ee7

## 摘要

字节跳动的技术团队搞了个叫 GRN（生成式精炼网络）的新架构，想给视觉生成找第三条路，不跟扩散模型和自回归模型硬卷。它的核心思路是让模型先生成一张粗糙的图，再反复精修，就像画师先铺大色块再慢慢抠细节。为了解决反复修图容易把图修糊、错误越攒越多的问题，他们用了三项技术：HBQ（分层二元量化）把图片压成更紧凑的离散编码，减少信息损耗；全局精炼让模型每次修改...

## 推荐理由

字节这篇 GRN 想走扩散和自回归之外的第三条路，核心卖点是让模型像人画画一样边生成边修改。我会先打个折：130M 参数不算大，gFID 从 3.56 涨到 3.79，画质有小幅下降，但推理步数从 50 步压到平均 24 步，省了将近一半，这个取舍在轻量场景里可能划算。技术上有三个动作：HBQ 解决量化带来的画质损失，全局精炼缓解一步步画下去误差越攒越多的问题，复杂度采样让简单区域少画几步、复杂区域多画几步，不再固定步数。正文没披露在更大模型或更高分辨率上的表现，也没给实际推理延迟的毫秒数，所以现在只能说在小模型上验证了思路。对做图像生成落地、想降...

## 锐评

字节这个GRN架构想走扩散和自回归之外的第三条路，核心思路不新鲜——先生成粗糙图再反复精修，类似画师的工作流。真正有意思的是他们怎么解决反复修图带来的问题：用HBQ把图片压成更紧凑的离散编码减少信息损耗，全局精炼让模型每次修改都看整张图而不是局部，复杂度自适应采样则让模型自己判断哪些地方需要多修几笔、哪些地方可以少修。在1.3亿参数的小模型上，自适应采样把推理从固定50步压到平均24步，gFID从3.56变到3.79，质量基本没掉。这点先别太激动——模型太小，正文也没说在大规模模型上跑出来的效果，而且微信原文被验证墙挡住了，我只能根据摘要判断。还缺几个关键信息：跟同参数量的扩散模型比到底快多少、省多少算力，以及生成高分辨率图时精修过程会不会崩。
