# Monet：让多模态模型在脑子里直接画图推理，不用每次都调外部工具

> 原标题：Monet：赋予多模态大模型如人类一般的抽象视觉思考能力

- 来源：机器之心 · 公众号
- 发布时间：2026-04-21T13:09:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/8962
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651029195&idx=3&sn=70aac86fca04a898838192b56c6e9a4d

## 摘要

Monet 把 Qwen2.5-VL-7B 改造成 Monet-7B，核心是让模型在连续的视觉潜空间里做抽象推理，而不是每次都去调用外部画图或识别工具。训练分三步：先用 12.5 万条数据做监督微调，再用 VLPO 强化学习对齐偏好。在分布内任务上比原版模型提升 3% 到 9.75%，在分布外的抽象视觉推理上提升 2.31%。论文被 CVPR 2026...

## 推荐理由

这篇讲的是Monet，基于Qwen2.5-VL-7B做的一个模型，核心是让多模态模型像人一样做抽象视觉思考。它不用外部工具，而是用连续隐式视觉嵌入来搞定，这点我会先打个折——思路不新，但工程上做得扎实。论文已被CVPR 2026接收，代码、模型和125K条SFT数据都开源了，对想复现的人友好。方法分三阶段SFT加一个叫VLPO的强化学习，用偏好样本教模型学回答风格。文中说分布内任务比基座好3%到9.75%，分布外抽象视觉推理提升2.31%，数字看着还行，但别太激动，因为没披露统一榜单的完整绝对分数，不知道跟其他模型比到底排第几。真正值得盯的是它把V...

## 锐评

这篇讲的是 Monet-7B，把 Qwen2.5-VL-7B 改造成能在连续视觉潜空间里做抽象推理的模型。核心思路是不再每次调用外部画图或识别工具，而是让模型自己在内部完成“想象”和推理。训练分三步：先用 12.5 万条数据做监督微调，再用 VLPO（一种偏好对齐的强化学习方法，教模型按人类偏好输出）做对齐。论文被 CVPR 2026 接收，代码、模型和数据集都开源了。

提升数字看着还行：分布内任务比原版模型高 3% 到 9.75%，分布外的抽象视觉推理提升 2.31%。但这里有个关键信息缺口——正文没给统一的绝对分数表，只说了相对提升。没有基准线绝对值，就很难判断这些百分比到底是从 50% 提到 55%，还是从 80% 提到 82%，实际意义差很多。另外，12.5 万条 SFT 数据量不算大，泛化能力还得看更多场景验证。

我会先打个折看这些数字。如果后续能补上绝对分数和更多分布外测试，才能判断这个“潜空间推理”路线是不是真比工具调用路线省钱又稳定。
