# Reddit 网友拿 9 个模型做功能规划对比，Claude Opus 4.6 生成的规格书最贵也最详细

> 原标题：compared some models for feature planning

- 来源：r/LocalLLaMA
- 发布时间：2026-04-20T11:00:31.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6915
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sqlz4p/compared_some_models_for_feature_planning/

## 摘要

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能，再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一，产出一份 19KB 的规格书，过程中读了 44 次代码，花了 2.47 美元；GLM 5.1 排第二，Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

## 推荐理由

这是一次有名有姓的个人实测，给出了真实工作流里的数据，所以 H、K、R 三项都站得住。但天花板不高：只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果，我会先打个折，放在 featured 里偏低的位置。

## 锐评

这条帖子更像一次个人实验，不是严谨评测。作者让 9 个模型给一个 Go 记账 App 设计功能规格，然后用 Claude Code 自动打分排名。Claude Opus 4.6 排第一，GLM 5.1 第二，Qwen 3.6 35B 本地部署版第三。Opus 4.6 的规格书有 19KB，过程中读了 44 次代码库，花了 2.47 美元，说明它在理解现有代码上投入了不少 token，产出的文档也更详细。

但这里有几个坑要先说清楚。第一，排名是 Claude Code 自己打的，等于让 Claude 当裁判又当选手，Opus 4.6 排第一可能有偏好加成。第二，正文没披露任何人工质量复核，不知道这些规格书实际能不能用、有没有漏需求。第三，作者自己强调这不是代表性测试，样本只有一个任务、一个代码库，换一个场景排名可能完全不同。

GLM 5.1 能排第二有点意外，说明国产模型在代码规划这类结构化任务上追得挺快。Qwen 3.6 35B 用 fp8 量化加 vLLM 本地跑也能进前三，对想省钱本地部署的人来说是个参考点。但整体看，这个实验缺的东西太多：没有对照人工写的规格书、没有评估规格书落地后的开发效率、也没有测不同模型在类似任务上的稳定性。结论只能当个谈资，别拿来选型。
