# Agent 里的调度模型能做多小？有人用 3B 激活参数的 MoE 跑通了本地 ReAct 循环

> 原标题：How small can the orchestration model in an agent be? (separating it from code-gen — that obviously wants a big model)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-22T17:46:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25671
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tkqal0/how_small_can_the_orchestration_model_in_an_agent/

## 摘要

这篇帖子来自一个叫 HomoAgens1 的本地部署实验，他把 Agent 的调度模型和写代码的大模型拆开看，专门测调度环节能缩到多小。他用的 Qwen3.6-35B-A3B 是个 MoE 模型，实际干活时只激活约 3B 参数，跑在一块 12GB 显存的 GPU 上，关了 30 个专家做 offload，生成速度能到每秒 40 个 token。实验发现...

## 推荐理由

我会先打个折：这是 Reddit 上的单人实验，不是正式发布，结论别当定论。但它的发现很实在——用 Qwen3.6-35B-A3B 跑 ReAct 编排，3B 激活参数就能在 12GB 显卡上跑到 40 t/s，成本够低。更小的模型不是推理先崩，而是工具调用纪律先坏，这个失败模式对选型很有参考价值。显存、速度和故障点都给了具体数字，对想在家用显卡上折腾 agent 的人是一手好参考。

## 锐评

这个实验把 agent 的调度和写代码拆开，专门测调度模型能缩多小。用 Qwen3.6-35B-A3B 这个 MoE 模型，实际只激活约 3B 参数，跑在 12GB 显存上，关了 30 个专家做 offload，生成速度能到每秒 40 个 token。实验发现，更小的稠密模型最先在工具调用纪律上出问题，比如自己编造参数、重复错误调用，而不是推理能力先崩。这点挺反直觉——通常大家觉得小模型先输在脑子不够用，但这里先输在手脚不老实。

不过正文没披露具体测了哪些小模型、用的什么 benchmark，也没说工具调用失败率的具体数字。实验只跑在本地 ReAct 循环里，场景比较单一，换到更复杂的多步任务或不同框架下结论可能不一样。另外，MoE 模型 offload 专家后实际推理成本到底省了多少，也没给量化对比。

还缺的是：小模型在工具调用上崩，是因为训练数据里工具调用样本太少，还是模型容量本身就不够记住工具 schema？如果能补上这个归因，对选模型会更有指导意义。
