跳到正文
r/LocalLLaMA

Qwen3.6-35B-A3B 和 9B 登上 Terminal-Bench 2.0 公开榜,小模型在硬核智能体测试里能跑分了

Qwen3.6-35B-A3B and 9B are officially on the public Terminal-Bench 2.0 leaderboard!

Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 的公开排行榜。搭配 little-coder 这套脚手架(给模型加了一套在终端里干活的外壳),35B-A3B 版本跑出 24.6%(±3.2),压过了 Gemini 2.5 Pro 在 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 在 Terminu...

推荐理由:Qwen3.6-35B-A3B 在 Terminal-Bench 2.0 上拿了 24.6%±3.2,比 Gemini 2.5 Pro 在 Gemini CLI 下的 19.6% 和自家 480B 大模型的 23.9% 都高。35B-A3B 这种规模能打,说明小模型做终端 agent 有戏,部署成本会友好很多。不过这是 Reddit 帖子,只贴了排行榜数字,测试怎么跑的、能不能复现,正文都没说。分数本身有参考价值,但别急着当定论,先打个折看。

读原文 ↗导出 Markdown