跳到正文

#RAG

今日 0 条

6月10日星期三

r/LocalLLaMA

ICML 论文提出可预测幻觉的“回答-弃权”闸门,并开源 ntkMirror 免训练实现

这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...

推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。

6月7日星期日

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

6月6日星期六

AI HOT 精选

谷歌给企业级 Gemini 搭了个“多代理协作”的外挂资料库框架,查事实类问题准确率最高提升 34%

谷歌研究院和谷歌云一起搞了个叫“跨语料库检索”的框架,用在 Gemini 企业智能体平台上,本质是让多个 AI 代理分工合作:一个负责理解问题并拆解计划,一个负责改写查询词,一个负责把问题路由到最合适的数据库,还有一个反复去搜、去验证。这套流程比传统 RAG(给模型外挂资料库直接查)在事实类数据集上准确率最多高出 34%。文章没细说测试用的具体数据集规...

推荐理由:谷歌把 RAG 拆成多个代理分工干活,在事实类数据集上准确率最多高出 34%,这个数字挺抓人。不过文章没披露测试用的具体数据集规模和难度,所以这个 34% 的含金量得打个折看。另外,框架绑在 Gemini 企业平台上,有给自家云服务带货的味道,所以分数没给到纯研究框架那档。

5月19日星期二

新智元 · 公众号

港中大和浙大团队认为,现在 AI Agent 的“记忆”只是备忘录,不是真记忆

这篇文章的正文被微信环境验证挡住了,具体实验细节看不到。从标题和现有摘要看,港中大和浙大的研究者戳破了一个常见说法:主流 AI Agent 的记忆模块,本质上是把过往信息存起来、用的时候再检索出来,相当于一个备忘录,而不是真正具备推理能力的记忆。他们指出,处理需要组合多个步骤的任务时,这种检索式记忆需要的案例数会按 k² 增长,成本很高。另外在一个叫 ...

推荐理由:我会先打个折:这篇不是模型发布,而是研究信号,但信号很强。标题把“记忆”的谎言直接戳破,正文用 Ω(k²) 和 90% 攻击成功率两个数字把问题量化得很清楚,不是空谈风险。对做 Agent 和外挂资料库的人,这三个点——记忆退化、检索投毒、案例爆炸——都是实打实的工程隐患,所以 H、K、R 全中。

5月15日星期五

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

4月27日星期一

Hacker News 首页

TurboQuant 走读:把 AI 向量压到每个数 2–4 比特,还不怎么掉精度

这篇交互式文章把 TurboQuant 的核心思路拆了一遍。它要解决的是怎么把模型里的高维向量(比如 KV 缓存、嵌入向量)压到每个坐标只占 2 到 4 个比特。做法很取巧:先给向量随机转个方向,转完之后每个坐标的数值分布就固定了,近似一个钟形曲线。接着用一套提前算好的通用码本去套所有输入,省掉了给每组数据单独算缩放因子的开销,也不需要训练或校准。文章...

推荐理由:我会先打个折:这不是模型或产品发布,只是一篇技术走读,所以重要性停在 76。但 HKR 三项都站得住——钩子够具体,机制解释有新东西,成本角度也切中当前推理优化的刚需。正文没给大规模验证数据,这点先别太激动,但思路本身值得一看。

4月18日星期六

量子位 · 公众号

RAG 搜对了文档却答错?德国萨尔大学团队找到病根,ACL 2026 长文收录

萨尔大学团队发现,很多 RAG 系统翻车不是因为没搜到资料,而是模型读不懂搜回来的文档。他们提出 Disco-RAG,在检索和生成之间加了一层“阅读理解”:先用修辞结构理论把文档拆成论证树,再建跨段落关系图,最后生成大纲来引导回答,全程不用额外训练。论文在 Loong、ASQA、SciNews 几个数据集上都有提升,但正文没给出具体分数,这点先别太激动。

推荐理由:这篇论文的卖点不是又刷了一个榜,而是把 RAG 的故障点拆开了:检索没问题,问题出在生成前的理解环节。我会先打个折,因为正文没完整披露三个基准上的具体分数,外部复现也还没看到,所以分数停在 80。但诊断结论本身对从业者有用,值得放进 featured。