# GPT-5.6 Luna 对比 GPT-6 Astra：花 3.6% 的钱，能抓到 75% 的代码 bug 吗？

> 原标题：GPT-5.6 Luna vs. GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review?

- 来源：Hacker News 首页
- 发布时间：2026-09-14T19:56:20.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56552
- 原文：https://entelligence.ai/blogs/gpt-5.6-luna-vs-gpt-6-astra-is-a-1.20-model-good-enough-for-code-review

## 摘要

Entelligence 用 50 个真实 PR 测了这两个模型做代码审查。Luna 每百万输出 token 只要 1.2 美元，Astra 要 50 美元，单次审查成本差了 28 倍。最终 Luna 找到 69 个确认 bug，Astra 找到 92 个。但 Luna 的误报率高得多，93 条意见里有 24 条是错的，Astra 只有 4 条。在 S...

## 推荐理由

Entelligence 自己测了自己的模型，正文没交代这 50 个 PR 从哪来、有没有人类审查员做对照，独立性要打个折。但实验设计清楚，成本、召回、误报率都给了具体数字，对选模型做代码审查的人有参考价值。

## 锐评

Entelligence 拿 50 个公开 PR 做了次硬核比价。主角是 GPT-5.6 Luna 和 GPT-6 Astra，前者输出每百万 token 只要 1.2 美元，后者要 50 美元，单次审查成本差了 28 倍。最终 Luna 找出 69 个确认 bug，Astra 找出 92 个。但 Luna 的毛病是嘴碎还不准：93 条意见里 24 条是假的，Astra 96 条里只错了 4 条。在 Sentry、Discourse、Grafana 这几个项目上，Luna 跟 Astra 的差距只有一两个 bug，但在 Keycloak 这种身份认证服务器上，Luna 只找到 6 个，Astra 找到 14 个，准确率才一半。安全漏洞的差距最大，9 对 19。

这个结果说明 Luna 在常规逻辑错误上性价比极高，花小钱办大事。但它的高误报率意味着人工复核成本会上去，而且一碰到认证、权限这类安全敏感代码就明显拉胯。正文没提审查延迟和并发吞吐量，实际落地还得看这些。另外，验证环节用了 Astra 自己当裁判，可能让它占点便宜，这个偏差得心里有数。
