# 多模态模型的价值，不在看懂图，在会自己去看

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-30T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53812
- 原文：https://yage.ai/share/agentic-vision-20260830.html

## 摘要

8月，Meta、Z.ai和DeepSeek三家实验室不约而同地展示了同一种多模态模型用法：模型先观察视频或截图，调用工具生成网页、幻灯片或小游戏，再回头审视自己做出来的东西。这跟2023年RAG从静态检索变成模型主动搜索的转折很像，但这次闭环方向反了——模型是先产出，再自己看一遍来验证。评测方式也跟着变了，Meta的WildArtifactBench不...

## 推荐理由

三家实验室独立演示了同一个多模态用法，把视觉从被动理解变成主动验证，类比2023年 agentic RAG 的范式转移很有说服力。扣分是因为这是评论性综述而非一手研究，但判断准确、信息密度高，对从业者有直接启发。

## 锐评

这篇文章抓到了一个很关键的范式转移：多模态模型的价值正从“看懂图”转向“会自己去看”。8月 Meta、Z.ai 和 DeepSeek 不约而同展示的案例，都是模型先观察输入，调用工具生成网页或幻灯片，再回头审视渲染结果并修正。这跟 2023 年 RAG 从静态检索变成模型主动搜索的转折很像，但方向反了——这次是模型先产出，再自己看一遍来验证，形成从模型到世界再回到模型的闭环。

评测和训练方法也跟着变了。Meta 的 WildArtifactBench 不再用标准答案打分，而是让裁判对模型做出的完整产物进行两两比较，用 Elo 分来排名，AI 裁判和人类裁判各做了约 2000 次对比来相互印证。训练上，GLM 和 Meta 都把“生成-审视-修改”的完整交互轨迹当成训练数据，让模型在推理时能自主重复这套动作。

对开发者来说，选型重点得从静态看图准确率，转向模型能不能在真实环境里跑通观察-生成-检查的完整闭环。不过正文没给出这套新评测方式下各模型的具体 Elo 分数和成本数据，也没说明在复杂、长步骤任务里，模型自我修正的成功率和卡住的情况，这些缺口让“会自己去看”的实际可靠性还得打个问号。
