跳到正文
Hacker News 首页

SWE-rebench 排行榜:13 个模型和 4 个编程助手在真实修 Bug 任务上的表现

13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS

Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭了这个测试。Fable 5 排第一,修好了 64.5% 的 Bug,每个问题成本 4.40 美元。Grok 4.5 和 Opus 5 也都超过 63%,但 Grok 4.5 每个问题只要 1.47 美元,便宜不少。在编程助手(Agent)里,Junie 修好 61.8%,成本 ...

推荐理由:Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭的测试,把模型和编程助手放在一起跑,还给了透明成本。三个维度都踩中了,但这是第三方评测,不是模型发布,所以分数没给到 85。

读原文 ↗导出 Markdown