# 一个用公司内部数据测 RAG 的开放基准，模拟了 9 种数据源和 10 类检索失败模式

> 原标题：An Open Benchmark for Testing RAG on Realistic Company-Internal Data

- 来源：r/LocalLLaMA
- 发布时间：2026-05-06T12:58:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14973
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t5c5qn/an_open_benchmark_for_testing_rag_on_realistic/

## 摘要

EnterpriseRAG-Bench 放出了一个 50 万文档的语料库，专门用来测 RAG 在公司内部数据上的表现。它模拟了 Redwood Inference 的 9 种数据源，并围绕 10 种检索失败模式设计了 500 个问题。基线测试显示，BM25 在整体上优于向量检索，而基于 agent/bash 的检索方式虽然完整度最高，但成本和延迟也明显更高。

## 推荐理由

HKR 三项都站得住：基准瞄准了企业 RAG 的真实痛点，50 万文档加上 BM25 反直觉的结果有话题性。不过来源只有一篇 Reddit 发布帖，信息密度还不到当天必写的程度，所以放在 featured 里。

## 锐评

EnterpriseRAG-Bench 放出了一个挺实在的测试集：50万份文档，模拟一家叫 Redwood Inference 的公司内部9种数据源，专门用来测外挂资料库（RAG）在真实业务场景下的检索能力。它没有只比谁跑分高，而是围绕10种常见的检索翻车模式设计了500个问题，这点比很多学术基准更接地气。

基线结果有个反直觉的发现：老派的 BM25 关键字匹配，整体表现居然压过了向量检索。基于 agent 或命令行脚本的检索方式完整度最高，但代价是成本和延迟明显更高。原文没给出具体的准确率数字和成本对比，所以“好多少”和“贵多少”暂时没法量化。

还缺两样东西：一是这套数据到底多像真实公司的信息杂烩（权限混乱、格式不一、过期文件），正文没展开；二是测试只覆盖了检索环节，没把大模型生成答案的质量一起拉通评估，实际落地效果还得自己补测。
