# 用本地 Qwen3.6 给 Claude Code 当副手，每次任务省下 30 倍 Opus token

> 原标题：Using Qwen3.6 via LM Studio as a Claude Code subagent, saving 30x Opus tokens per task

- 来源：r/LocalLLaMA
- 发布时间：2026-04-20T03:09:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6506
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sqdg0u/using_qwen36_via_lm_studio_as_a_claude_code/

## 摘要

一位 Reddit 用户把 Qwen3.6 通过 LM Studio 接成 Claude Code 的 subagent，让本地模型干提取和审计的粗活，Claude 只做最后决策。在两个审计任务里，Opus 的边际 token 消耗降了约 30 倍：一个 23 个文件的路由审计从 1.3 万 token 降到 400 token，一个 18 个文件的 ...

## 推荐理由

一个 Reddit 用户拿自己的两台机器做了两组任务对比，数字很直接：23 个路由文件审计从 13k token 降到 0.4k，18 个 Astro 文件盘点从 89k 降到 3k，省了约 30 倍 Opus token。机制是把提取、盘点、审计这类工作交给本地 LM Studio 跑的 Qwen 子代理，Claude Code 只做调度。正文没藏着掖着，承认 Qwen 和 Opus 各有漏检，不是单方面碾压。我会先打个折：只有两个任务、一个人跑、没大规模验证，但思路和数字对想省 Opus 费用的人有直接参考价值。

## 锐评

这条分享的省钱思路很直接：把 Qwen3.6 当成 Claude Code 的 subagent，让本地模型干提取和审计的粗活，Claude 只做最后决策。在作者举的两个例子里，一个 23 个文件的路由审计，Opus 的边际 token 从 1.3 万降到 400；另一个 18 个文件的 Astro 站点盘点，从 8.9 万降到 3000。降幅确实有 30 倍左右，用的是 unsloth 的 Qwen3.6-35B-A3B-MXFP4_MOE 量化版，跑在一台 64GB 内存的 M4 Max 上，上下文窗口开到 64k。

不过得打几个折。第一，这只是两个任务上的边际 token 对比，不是系统性的基准测试，换一批任务降幅可能没那么夸张。第二，作者自己说了，本地模型产出的质量是“mixed”，不是严格比 Opus 好，更像是“够用但别太挑”。第三，正文没披露任务的具体难度和错误率，也没说这套 subagent 的调度逻辑有多复杂、会不会引入新的延迟或失败点。

如果你手头有能跑 35B 量化的机器，这个方向值得试，但先别把它当成稳省 30 倍的银弹。还缺的是更多任务类型下的 token 节省数据、质量对比的量化指标，以及这套流程在真实开发场景里的稳定性报告。
