# 让 GPT-5.6、Claude、Gemini 和 Grok 用彩色铅笔“画”蒙娜丽莎

> 原标题："Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok

- 来源：Hacker News 首页
- 发布时间：2026-07-21T21:13:20.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45746
- 原文：https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok

## 摘要

TryAI 搭了个画布擂台，给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 一套彩色铅笔工具，让它们照着蒙娜丽莎和星月夜两张图复刻，外加五道开放命题作画，一共跑了 28 幅。模型可以自己选颜色、笔尖粗细、下笔力度，还能涂抹、擦除、随时看一眼画布再改。GPT-5.6 Sol 在结构相似度（...

## 推荐理由

TryAI 搭了个画布擂台，给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 一套彩色铅笔工具，让它们照着蒙娜丽莎和星月夜复刻，外加五道开放命题，一共跑了 28 幅。模型可以自己选颜色、调笔尖粗细、控制下笔力度，还能涂抹、擦除、随时看一眼画布再改。GPT-5.6 Sol 在结构相似度上领先，但每笔成本也最高；Gemini 3.6 Flash 便宜但细节糊成一团。这个测试把“工具调用 + 视觉反馈”的差距直接摊在画布上，比跑分直观得多。

## 锐评

TryAI 让四款前沿模型用彩色铅笔工具复刻名画，这比跑分更能看出模型在模糊、长链条任务里的真实水平。GPT-5.6 Sol 在结构相似度上拿了最高分，说明它对画面整体布局和色彩层次的理解更到位。Claude Fable 5 的表现就有点反直觉了：它耗时最长、烧钱最多，但成品质量反而垫底。这提醒我们，模型在需要持续观察、调整、纠错的 agent 类工作流里，推理能力强不代表执行效率高，选模型得把时间和成本一起算进去。Grok 4.5 画得吃力，而几个开源模型直接交了白卷，侧面印证了这类任务确实能拉开前沿模型和追赶者的差距。不过文章没给出具体的耗时分钟数和花费金额，也没解释 SSIM 分数到底差多少算显著，这些缺口让“贵且差”的判断少了点量化支撑。另外，开放命题作画的结果也没展开，不知道模型在自由创作时会不会有意外惊喜。
