跳到正文
r/LocalLLaMA

一个用公司内部数据测 RAG 的开放基准,模拟了 9 种数据源和 10 类检索失败模式

An Open Benchmark for Testing RAG on Realistic Company-Internal Data

EnterpriseRAG-Bench 放出了一个 50 万文档的语料库,专门用来测 RAG 在公司内部数据上的表现。它模拟了 Redwood Inference 的 9 种数据源,并围绕 10 种检索失败模式设计了 500 个问题。基线测试显示,BM25 在整体上优于向量检索,而基于 agent/bash 的检索方式虽然完整度最高,但成本和延迟也明显更高。

推荐理由:HKR 三项都站得住:基准瞄准了企业 RAG 的真实痛点,50 万文档加上 BM25 反直觉的结果有话题性。不过来源只有一篇 Reddit 发布帖,信息密度还不到当天必写的程度,所以放在 featured 里。

读原文 ↗导出 Markdown