Tmax 在终端测试上拿了 42.7%,但分数背后是基座模型的红利和测试本身的坑
别只看 42.7%:Tmax 背后的 RL 配方、基座红利和 Benchmark 陷阱
Ai2 和华盛顿大学开源了 Tmax-9B/27B,在 Terminal-Bench 2.0 上分别跑到 27.2% 和 42.7%。27B 的分数看着和 DeepSeek-v3.2、Kimi K2.5 这些大模型差不多,但拆开看,Qwen 3.6 基座自己就已经拿了 39.6%,强化学习(RL)训练实际只多贡献了 3.1 个百分点。9B 版本上 RL...
推荐理由:Tmax 用 9B 和 27B 的参数量在 Terminal-Bench 2.0 上跑出了接近大模型的分数,还公开了完整训练配方和模型权重,对从业者来说可复现性高,值得关注。但拆开看,Qwen 3.6 基座本身已经拿了 39.6%,RL 训练实际只多贡献了 3.1 个百分点,9B 版本 RL 后甚至不如基座,说明 RL 配方的增益有限,分数上限被基座能力锁死了,所以重要性给不到 85 以上。