# 小模型做智能体流程不流行，不是能力不行，是商业账算不过来

> 原标题：The reason small-model agent stacks aren't the default has nothing to do with whether they work

- 来源：r/LocalLLaMA
- 发布时间：2026-05-25T13:50:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27010
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tn9sup/the_reason_smallmodel_agent_stacks_arent_the/

## 摘要

这篇帖子直接点破：小模型搭的智能体方案没成为主流，跟技术能不能跑通关系不大，核心是商业风险和验证成本。作者举了两个例子——Gemma 4 31B 在 tau2-bench 上能跑到 86.4% 的准确率，DeepSeek V4-Flash 的输出 token 价格差不多是 Claude Opus 4.6 的 89 分之一，单看指标和成本都挺能打。但问题...

## 推荐理由

这篇文章的切入点挺刁钻——小模型 agent 栈没普及，不是性能不行，是验证层掉链子。它拿 Gemma 4 31B 在 tau2-bench 上 86.4% 的成绩和 DeepSeek 低到离谱的输出成本说事，数字本身有说服力。但更值得盯的是那个 7-9B 模型做验证时，一半到三分之二的正确答案推理链其实有缺陷，这个发现直接动摇了用小模型兜底的信心。来源是 Reddit，权威性要打个折，所以分数没给到顶，但话题本身对做 agent 落地的人很解渴。

## 锐评

这篇帖子把商业账算得很直白：小模型智能体方案卡在验证成本上，不是能力不够。作者引用的数据挺有冲击力——Gemma 4 31B 在 tau2-bench 上拿到 86.4% 的准确率，DeepSeek V4-Flash 输出 token 价格大约是 Claude Opus 4.6 的 89 分之一，单看指标和成本确实能打。但问题出在可靠性审计上：一项被引用的审计显示，7 到 9B 规模的模型在给出正确答案时，有大约一半到三分之二的情况下推理过程是断裂的。这意味着你省下的推理费用，可能得加倍花在人工复核上。

帖子本身来自 Reddit r/LocalLLaMA，46 个赞和 45 条评论说明社区关注度不低，但讨论里也没挖出更多定价细节。原文链接指向彭博社报道，不过我们拿到的 RSS 源被 Reddit 网络拦截了，实际文章内容没抓到，所以目前只能基于帖子摘要做判断。

还缺两块关键信息：一是 DeepSeek 这个定价是限时促销还是永久调价，二是那项审计的具体样本量和任务类型。在官方公告和完整审计报告出来前，这条新闻更适合当行业风向标看，别急着当采购依据。
