# Specific 发布 Real-SWE 基准：让 AI 在 8 家公司的真实私有代码库上干活，第一名解决率也只有 38.8%

> 原标题：Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases

- 来源：Hacker News 首页
- 发布时间：2026-09-12T20:25:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56161
- 原文：https://withspecific.com/benchmarks/real-swe

## 摘要

Specific 从 8 家公司拿到了真实的私有生产代码库，把工程师实际要处理的任务丢给 8 个前沿模型去跑。这些任务不是刷题，而是修税计算、做客户迁移这种会影响业务的事，模型得自己看懂每家公司的代码规范和业务规则。结果最好的组合是 Anthropic 的 Fable 5.1 搭配 Claude Code，解决率 38.8%；GPT-6 Astra 是...

## 推荐理由

我会先打个折：38.8% 的解决率看着不高，但这是拿真实生产任务测出来的，不是刷题。Specific 从 8 家公司拿到了私有代码库，让模型去修税计算、做客户迁移这种会影响业务的事，模型得自己看懂每家公司的代码规范和业务规则，没有现成答案可抄。Fable 5.1 配 Claude Code 拿了第一，GPT-6 Astra 也上榜了，但正文没披露具体任务难度分布和失败原因，这点先别太激动。对 AI 从业者来说，这是目前最接近“让模型进生产代码库干活”的第三方基准，比 SWE-bench 那种公开题库更有参考价值，但样本只有 8 家公司，结论别急着推...

## 锐评

Specific 从 8 家公司拿了真实的生产代码库，让模型去修税计算、做客户迁移这类真会影响业务的活。结果最好的组合是 Anthropic 的 Fable 5.1 配 Claude Code，解决率 38.8%；GPT-6 Astra 是 33.8%，Gemini 3.8 Flash 是 31.2%。这个数字比那些刷题榜低得多，但含金量也高得多——模型得自己看懂每家公司的代码规范和业务规则，没法靠背公开答案。

不过正文没披露总任务量和单任务时限，这会影响我们对稳定性和成本的判断。另外，38.8% 的解决率意味着大部分任务还是做不完，企业真要部署的话，得先算清楚人工兜底的成本。

还缺一个关键信息：模型失败时是直接给错结果，还是卡在半路需要人接手。这两种失败对业务流程的影响完全不同。
