# CodeRabbit 实测 GPT-6 Astra：跨文件找 Bug 比 Sol 多抓 20%，但 API 价格贵了 1.5 倍

> 原标题：GPT-6 Astra in code review: Gains, privacy, and cost

- 来源：Hacker News 首页
- 发布时间：2026-09-05T03:38:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54942
- 原文：https://www.coderabbit.ai/blog/gpt-6-astra-code-review-evaluation

## 摘要

CodeRabbit 拿自家代码审查基准测了 OpenAI 新模型 GPT-6 Astra。整体上，Astra 能找出、且开发者能直接用的 Bug 比上一代 GPT-5.6 Sol 多了约 4%。真正的差距在跨文件审查这种硬活上：Astra 的 Bug 发现率比 Sol 高出 20%，比 Opus 5 高出 33%。这说明模型在把散落各处的代码逻辑串起...

## 推荐理由

CodeRabbit 拿自家基准测了 GPT-6 Astra，整体可用 Bug 发现率只比 Sol 高约 4%，我会先打个折——这点提升不算大。真正的看点是跨文件审查：Astra 比 Sol 多找出 20% 的 Bug，比 Opus 5 多 33%，说明模型在理解跨文件逻辑这种最头疼的场景上确实有长进。文章还给了成本和隐私数据，不是纯跑分。但这是单一厂商的评测，不是独立基准，Astra 本身也还没大规模铺开，所以重要性卡在 82 不往上加。

## 锐评

CodeRabbit 拿自家基准测了 OpenAI 新模型 GPT-6 Astra，最值得看的是跨文件审查这块：Astra 能揪出、且开发者能直接用的 Bug 覆盖率达到 57.1%，比 GPT-5.6 Sol 高出约 20%，比 Opus 5 高出 33%。这说明模型在把散落各处的代码逻辑串起来这件事上确实有进步，不是只盯着改动的几行看。整体 Bug 发现率提升约 4 个百分点，幅度不大，因为简单审查里天花板本来就低，强模型拉不开差距。

不过这篇评测有几个关键信息没给：基准到底测了多少样本、Bug 类型怎么分布、误报率是多少。没有这些，绝对数字只能当个方向参考，不能直接换算成团队能省多少事。另外价格得算账：Astra 输入每百万 token 10 美元，输出 50 美元，跑一次 10 万 token 输入的任务成本大概是 Sol 的 2.5 倍。值不值，得看你手头的审查任务有多依赖跨文件推理。
