多模态模型的价值,不在看懂图,在会自己去看
8月,Meta、Z.ai和DeepSeek三家实验室不约而同地展示了同一种多模态模型用法:模型先观察视频或截图,调用工具生成网页、幻灯片或小游戏,再回头审视自己做出来的东西。这跟2023年RAG从静态检索变成模型主动搜索的转折很像,但这次闭环方向反了——模型是先产出,再自己看一遍来验证。评测方式也跟着变了,Meta的WildArtifactBench不...
推荐理由:三家实验室独立演示了同一个多模态用法,把视觉从被动理解变成主动验证,类比2023年 agentic RAG 的范式转移很有说服力。扣分是因为这是评论性综述而非一手研究,但判断准确、信息密度高,对从业者有直接启发。