# Qwen3.6-35B-A3B 和 9B 登上 Terminal-Bench 2.0 公开榜，小模型在硬核智能体测试里能跑分了

> 原标题：Qwen3.6-35B-A3B and 9B are officially on the public Terminal-Bench 2.0 leaderboard!

- 来源：r/LocalLLaMA
- 发布时间：2026-05-16T07:19:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21684
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1temio0/qwen3635ba3b_and_9b_are_officially_on_the_public/

## 摘要

Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 的公开排行榜。搭配 little-coder 这套脚手架（给模型加了一套在终端里干活的外壳），35B-A3B 版本跑出 24.6%（±3.2），压过了 Gemini 2.5 Pro 在 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 在 Terminu...

## 推荐理由

Qwen3.6-35B-A3B 在 Terminal-Bench 2.0 上拿了 24.6%±3.2，比 Gemini 2.5 Pro 在 Gemini CLI 下的 19.6% 和自家 480B 大模型的 23.9% 都高。35B-A3B 这种规模能打，说明小模型做终端 agent 有戏，部署成本会友好很多。不过这是 Reddit 帖子，只贴了排行榜数字，测试怎么跑的、能不能复现，正文都没说。分数本身有参考价值，但别急着当定论，先打个折看。

## 锐评

Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 排行榜，搭配 little-coder 这套脚手架（给模型加了一层在终端里直接敲命令干活的外壳），35B-A3B 版本跑出 24.6%（±3.2），压过了 Gemini 2.5 Pro 在自家 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 的 23.9%。9B 小模型也拿了 9.2%，虽然不高，但至少证明 10B 以下的本地模型在这种硬核任务上不是零分选手。

分数本身要打个折。24.6% 意味着大部分任务还是没搞定，而且 ±3.2 的波动不算小，说明稳定性有待验证。另外，正文没披露测试的具体任务分布和失败模式，也不知道 little-coder 这套脚手架本身对分数的贡献有多大——换一个外壳会不会结果差很多，这点还不清楚。

对本地部署的人来说，35B-A3B 这个尺寸能在消费级硬件上跑，还能在终端自动化这种实用场景里跟闭源大模型掰手腕，是个值得跟进的信号。但别急着下结论，等更多独立复现和不同脚手架下的对比出来再说。
