GPT-5.6 Luna 对比 GPT-6 Astra:花 3.6% 的钱,能抓到 75% 的代码 bug 吗?
GPT-5.6 Luna vs. GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review?
Entelligence 用 50 个真实 PR 测了这两个模型做代码审查。Luna 每百万输出 token 只要 1.2 美元,Astra 要 50 美元,单次审查成本差了 28 倍。最终 Luna 找到 69 个确认 bug,Astra 找到 92 个。但 Luna 的误报率高得多,93 条意见里有 24 条是错的,Astra 只有 4 条。在 S...
推荐理由:Entelligence 自己测了自己的模型,正文没交代这 50 个 PR 从哪来、有没有人类审查员做对照,独立性要打个折。但实验设计清楚,成本、召回、误报率都给了具体数字,对选模型做代码审查的人有参考价值。