# SWE-rebench 排行榜：13 个模型和 4 个编程助手在真实修 Bug 任务上的表现

> 原标题：13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS

- 来源：Hacker News 首页
- 发布时间：2026-07-31T15:28:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47887
- 原文：https://swe-rebench.com

## 摘要

Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭了这个测试。Fable 5 排第一，修好了 64.5% 的 Bug，每个问题成本 4.40 美元。Grok 4.5 和 Opus 5 也都超过 63%，但 Grok 4.5 每个问题只要 1.47 美元，便宜不少。在编程助手（Agent）里，Junie 修好 61.8%，成本 ...

## 推荐理由

Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭的测试，把模型和编程助手放在一起跑，还给了透明成本。三个维度都踩中了，但这是第三方评测，不是模型发布，所以分数没给到 85。

## 锐评

Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭了这个测试，覆盖 Go、Java、Python、Rust 和 TypeScript，比很多只测 Python 的榜单更贴近实际开发。Fable 5 修好了 64.5% 的 Bug，排第一，但每个问题要花 4.40 美元。Grok 4.5 和 Opus 5 也都超过 63%，不过 Grok 4.5 每个问题只要 1.47 美元，成本不到 Fable 5 的三分之一，性价比明显更高。在编程助手（Agent）里，Junie 修好 61.8%，成本 0.81 美元，比 Claude Code 的 3.39 美元便宜不少。DeepSeek-V4 Pro 修好 40.2%，每个问题只要 0.15 美元，是前 14 名里最便宜的，适合预算有限但能接受较低修复率的场景。

这个榜单有个明显的信息缺口：从第 18 名开始，Claude Opus 4.1 到 Sonnet 4.6 等一大串模型的结果全是 N/A，正文没解释是没跑完、跑崩了还是没提交。另外，榜单只给了总体修复率，没按编程语言拆开看各模型在不同语言上的表现，也没说明为什么有些模型用了大量缓存 token（比如 MiniMax M3 用了 97% 的缓存），这对实际部署的成本估算影响很大。
