# 我把多智能体调度器里的 Claude 换成本地 Qwen3.6-27B，跑了两个星期

> 原标题：Replaced Claude with local Qwen3.6-27B in my multi-agent orchestrator for 2 weeks

- 来源：r/LocalLLaMA
- 发布时间：2026-06-02T11:05:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/32840
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tunmam/replaced_claude_with_local_qwen3627b_in_my/

## 摘要

作者用一张 RTX 3090 跑 Qwen3.6-27B，在 47 个多步骤编程工作流里顶替 Claude 试了两周。计划生成的结构合规率大约 95%，但工具调用格式错误率有 12% 左右，而且上下文一超过约 12k token，实际表现就开始明显下滑。正文没披露具体任务难度和对比基准，所以 95% 这个数只能当个参考，别直接当成“接近 Claude”...

## 推荐理由

这篇值得看，因为它是真人两周实测，不是跑分。作者用一张消费级显卡把 Qwen3.6-27B 塞进多智能体编排里，替换 Claude，给出了能用的上限和会翻车的点。95% schema 合规听着不错，但 12% 工具调用格式错误意味着每八九次就有一次格式炸了，生产环境还得加校验层。长上下文到 12k tokens 就吃力，复杂任务得拆。正文没披露延迟数据和总 token 消耗，这点先别急着算成本账。整体是份诚实的工程笔记，不是公关稿。

## 锐评

这条分享挺实在的，没有吹“全面超越”，而是把坑也摊开了。作者用一张RTX 3090本地部署Qwen3.6-27B，在47个多步骤编程工作流里顶替Claude跑了两周。计划生成的结构合规率大约95%，说明模型能按预期格式输出，但工具调用格式错误率有12%，意味着每八九次调用就有一次格式不对，这在自动化流程里会直接卡住。更关键的是，上下文一超过约12k token，表现就开始明显下滑，长任务稳定性存疑。

不过得打个折：正文没披露这47个任务的具体难度，也没说对比的Claude是哪个版本、跑在什么配置上。95%这个数只能说明“格式上像样”，不代表任务完成质量接近Claude。另外，作者被Reddit网络拦截了，我们拿到的只是摘要，没法核实更多细节。

如果你也想在本地替掉商业API，这条经验值得参考，但先别激动。12%的工具调用错误率在生产环境里需要额外加校验和重试机制，长上下文退化也得靠分段或摘要来兜底。还缺的是延迟数据、显存占用峰值，以及更细分的任务类型对比，这些才是决定能不能真替的关键。
