# 本地跑代码模型终于能干活了：27B 模型在 Terminal-Bench 2.0 上拿了 38.2%，落后云端前沿模型约 6-8 个月

> 原标题：Local model on coding has reached a certain threshold to be feasible for real work

- 来源：r/LocalLLaMA
- 发布时间：2026-04-28T01:32:36.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/10523
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sxn7x2/local_model_on_coding_has_reached_a_certain/

## 摘要

Antigma 用一套 agent 流程测了多个 27B–32B 的开源模型，跑的是 Terminal-Bench 2.0 的 89 个任务，用的是官方默认超时设置，没放宽条件。成绩最好的是 Qwen 3.6-27B，89 题做对 34 题，得分 38.2%。这个分数本身不算高，现在云端最强的模型能到 80% 左右。但有意思的是时间差：把 38.2% ...

## 推荐理由

我会先打个折：这是单篇 Reddit 帖子，不是论文，测试细节和复现条件正文没展开。但它的判断很实在——本地小模型跑代码已经跨过“能用”的门槛，不是遥遥领先，而是落后托管前沿 6–8 个月，这个定位比单纯报分有用。38.2% 的分数本身不高，但放在 89 个终端任务里，说明日常写脚本、调配置这类活它能接住一部分。对想离线部署、省 API 钱的团队，这个信号值得跟。

## 锐评

Antigma 用一套 agent 流程测了几个 27B–32B 的开源模型，跑的是 Terminal-Bench 2.0 的 89 个任务，用的是官方默认超时，没放水。成绩最好的是 Qwen 3.6-27B，89 题做对 34 题，得分 38.2%。这个分数绝对值不高，现在云端最强的模型能到 80% 左右。但有意思的是时间差：把 38.2% 放到云端模型的发布时间线上看，大概对应 2025 年 8 月到 11 月之间 Claude Opus 4.1、GPT-5.1-Codex 这些模型的水平，也就是说本地模型落后云端前沿大概 6 到 8 个月。

这个差距以前更大，现在缩到半年左右，对一些场景开始有实际意义了——比如合规要求数据不能出内网、完全断网的环境、本地 CI 批量跑任务。正文没披露这套 agent 流程的具体开销和延迟，也没说 38.2% 是在什么硬件上跑出来的，这点先别太激动。另外他们提到 MoE 模型在推理速度上还有数量级的提升空间，但没给具体数字，只能当个方向看。
