# Simon Willison 用 Claude Fable 5.1 跑了五档推理强度的鹈鹕画画测试，最高档花了 3.3 美元画了 14 分钟

> 原标题：Claude Fable 5.1 made me a nice animated pelican

- 来源：Hacker News 首页
- 发布时间：2026-09-02T01:05:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54169
- 原文：https://simonwillison.net/2026/Sep/1/claude-fable-5-1/

## 摘要

Simon Willison 拿他经典的“画一只骑自行车的鹈鹕”提示词，把 Claude Fable 5.1 的五档推理强度全测了一遍。低和中两档几乎没区别，都没显示推理过程，23 秒左右出图，成本约 10 美分。开到 xhigh 档，模型花了 7 分 51 秒、烧了 1.83 美元，细节明显变多。最高档 max 跑了 13 分 54 秒，成本 3.3...

## 推荐理由

Simon Willison 做了一次很实在的对照实验，把同一句提示词在 Claude Fable 5.1 的五档推理强度下各跑一遍，给出了每档的耗时和花费。低档和中档几乎没区别，23 秒左右出图、成本约 10 美分；开到 xhigh 档细节明显变多，但花了近 8 分钟和 1.83 美元；最高档 max 跑了快 14 分钟、烧了 3.3 美元。这种带具体数字的横向对比比官方公告更有用，从业者可以直接判断自己该选哪一档。分数没给更高是因为这只是一次个人评测，不是模型能力的重大突破。

## 锐评

Simon Willison 这次测试很直观：同一个“画骑自行车的鹈鹕”提示词，Claude Fable 5.1 在低和中两档推理下表现几乎一样，都没显示推理过程，23 秒左右出图，成本约 10 美分。开到 xhigh 档，模型花了 7 分 51 秒、烧了 1.83 美元，细节明显变多；最高档 max 跑了 13 分 54 秒，成本 3.3 美元，是他见过 Anthropic 画得最好的鹈鹕，但他仍觉得不如 Gemini 3.7 Flash 有灵气。

这个对比说明，Fable 5.1 的推理强度调节对简单创意任务存在一个“阈值”：低中档几乎不思考，高档才开始认真琢磨。但即便烧到 max，Simon 也没觉得效果有质的飞跃，反而暴露了高推理档位成本高、延迟大的代价。

另外，Anthropic 官方重点宣传的科学基准 Terminal-Bench-Science 0.1 得分从 Fable 5 的 24.7% 跳到 52.6%，涨幅很大，但这是全新基准，缺乏历史对照和社区验证，实际意义还得看后续第三方评测。正文没披露其他常规编码或推理基准的具体提升幅度，只说“略有改善”，这点信息缺口让整体能力判断打了折扣。
