# GitHub 介绍 AI 代码审查开放基准 ReviewBench

> 原标题：ReviewBench: An open benchmark for AI code review

- 来源：GitHub Blog · AI & ML
- 发布时间：2026-10-05T15:59:40.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/tfwf1u5y4pse18i8021y1ywep
- 原文：https://github.blog/ai-and-ml/github-copilot/reviewbench-an-open-benchmark-for-ai-code-review/

## 摘要

GitHub 的 AI 代码审查开放基准 ReviewBench 已提供研究预览版，公开数据集、评估方法和自助运行工具。基准参考 103.9 million 个 GitHub 拉取请求的分布，包含来自 187 个仓库、覆盖 19 种语言的 219 个拉取请求，资深工程师独立复核标注的一致率为 96.6%。

## 推荐理由

ReviewBench 将固定标注与新增有效发现分开评估，在保持跨系统比较口径一致的同时，避免漏标问题惩罚审查智能体。

## 锐评

拿 103.9 million 个 PR 撑场面，结果测试集只有 219 个，感觉很容易被刷穿。219 个 PR 还要分摊给 19 种语言，平均一种语言才十来个用例，覆盖面其实很薄。187 个开源仓库也完全公开，专门针对这批样本微调或者做 prompt 适配，刷高分数一点都不难。这个基准太容易被定向针对，拿来比各家 agent 谁好谁坏我不太买账。
