跳到正文

#RAG

今日 0 条

5月24日星期日

r/LocalLLaMA

视觉模型直接读 PDF vs 先 OCR 再问答:一次长文档实测

作者用 Claude Sonnet 4.5 跑了 MMLongBench-Doc 里的 30 份带图、带表格的 PDF,共 171 道题,对比两种路线:让模型直接看 PDF 画面,和先用 OCR 把文档转成文字再喂给模型。直接看 PDF 的准确率只有 52.0%,在六套方案里排第五,每次查询成本 0.2552 美元。表现最好的是 LlamaCloud ...

推荐理由:作者拿 Claude Sonnet 4.5 直接读 PDF 图片,在 MMLongBench-Doc 上跑出 52.0% 准确率,每题烧掉 0.2552 美元,比 LlamaCloud 的 OCR 管线低了 7.6 个百分点。样本只有 30 份文档、171 道题,结论别急着推广,但至少说明现在原生视觉模型处理带图表的长文档还不稳,而且贵。正文没披露具体文档类型分布和问题难度,这点先打个折。

5月15日星期五

r/LocalLLaMA

实测外挂资料库客服机器人:最贵的模型表现最差,真正管用的是这几招

作者搭了一个客服用的外挂资料库(RAG)问答机器人,用模型当裁判打分,把质量分从 6.62 拉到了 7.88,同时单次会话成本从 $0.002420 砍到 $0.000509,降了将近八成。最反直觉的发现是:最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度,以及用五款模型做了一轮横向...

推荐理由:我会先打个折:这是个人实验,不是大规模生产验证,样本量和场景都有限。但作者把调优过程拆得很细,从最贵的模型翻车开始,一步步讲怎么换模型、调检索参数、改 prompt,最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说,这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集,这点有点可惜,但不妨碍它作为一份诚实的调参笔记入选。

AI HOT 精选

IBM 开源多语言嵌入模型 R2:不到 1 亿参数,32K 上下文,检索跑分在同级里最高

IBM 在 Hugging Face 上发了两个新的多语言嵌入模型,都走 Apache 2.0 协议。小号 9700 万参数,在 MTEB 多语言检索上拿了 60.3 分,正文说这是目前所有开源同尺寸模型里最高的。大号 3.11 亿参数,得分 65.2,在 5 亿参数以下的开放模型里排第二。两个模型都基于 ModernBERT,支持 200 多种语言(...

推荐理由:HKR 三项都过:一个不到 1 亿参数、支持 32K 上下文的多语言嵌入模型,给 RAG 开发者提供了一个轻量开源选项。影响面不如前沿模型发布那么大,放在 featured 档刚好。

5月14日星期四

AI HOT 精选

OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

OpenSquilla 这个开源项目把模型路由决策放在本地跑,不花 token 就能判断问题难易:简单问题丢给便宜模型,复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩,还支持混合检索。正文没披露具体测试场景和模型阵容,所以这 90% 的降幅在什么任务上测出来的还不清楚...

推荐理由:我会先打个折:信息来自一篇 X 上的项目帖,仓库实际活跃度、测试环境和局限性正文都没披露,所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成,等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说,哪怕只实现一半效果也值得关注。

5月6日星期三

r/LocalLLaMA

一个用公司内部数据测 RAG 的开放基准,模拟了 9 种数据源和 10 类检索失败模式

EnterpriseRAG-Bench 放出了一个 50 万文档的语料库,专门用来测 RAG 在公司内部数据上的表现。它模拟了 Redwood Inference 的 9 种数据源,并围绕 10 种检索失败模式设计了 500 个问题。基线测试显示,BM25 在整体上优于向量检索,而基于 agent/bash 的检索方式虽然完整度最高,但成本和延迟也明显更高。

推荐理由:HKR 三项都站得住:基准瞄准了企业 RAG 的真实痛点,50 万文档加上 BM25 反直觉的结果有话题性。不过来源只有一篇 Reddit 发布帖,信息密度还不到当天必写的程度,所以放在 featured 里。

2025年5月28日星期三