# 浙大和阿里给生图模型加了个“先想再画”的模块，画数独、烧蜡烛这类精细活终于不翻车了

> 原标题：画数独、烧蜡烛都不翻车了？浙大&amp;阿里让AI先三思再下笔｜ACL 2026

- 来源：量子位 · 公众号
- 发布时间：2026-05-26T05:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28128
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247893123&idx=3&sn=324e2f6977d0b2ea15ec462d8e403890

## 摘要

这篇论文提出了一个叫 Unified Thinker 的独立规划模块，专门解决生图模型一遇到需要精确空间推理的任务就乱来的问题。它不像以前那样让模型边想边画，而是把“思考”和“执行”拆开：先让模型生成结构化的推理步骤，再把这些步骤翻译成具体的视觉指令去生图。训练用了 4 万条叫 HieraReason-40K 的样本，分两阶段做强化学习，让模型学会在动...

## 推荐理由

这篇论文解决的是一个很实际的问题：多模态模型经常在需要一步步操作的视觉任务里翻车，比如画数独格子画错、烧蜡烛的步骤搞反。浙大和阿里的做法是给模型加一个独立的规划模块，用 4 万条专门构造的样本训练它先想清楚再下笔，再通过两阶段强化学习把思考过程转成可执行的视觉指令。正文没披露这个规划模块的具体参数量和推理延迟，所以实际部署成本还不好判断。但思路本身挺直接，如果规划模块够轻量，对提升视觉 agent 的可靠性会有帮助。

## 锐评

这篇论文解决了一个很实际的痛点：现在的生图模型一碰到需要精确空间推理的任务就容易乱来，比如画个数独格子都对不齐。浙大和阿里的做法是把“思考”和“执行”拆成两个阶段，先让模型生成结构化的推理步骤，再把这些步骤翻译成具体的视觉指令去生图，相当于让模型先打草稿再动笔。

训练用了4万条叫HieraReason-40K的样本，分两阶段做强化学习，这个样本量不算大，说明方法本身的数据效率可能还不错。但正文没披露具体用了哪个基座模型、推理步骤的生成质量怎么评估、以及这套流程在实际生图时会不会增加明显的延迟。另外，目前展示的任务集中在数独、蜡烛燃烧这类相对封闭的场景，能不能泛化到更开放的空间推理任务还不好说。

整体来看思路是清晰的，把推理和生成解耦这个方向值得关注，但实际落地效果还得看更多场景的验证。
