kapa.ai 用一个小模型砍掉了 68% 的 RAG 上下文,召回率还保住 96%
Pruning RAG context down to what the answer actually needs
kapa.ai 在检索器和生成器之间塞了一个便宜的小模型做“剪枝器”。它把问题和所有检索到的资料块一起读,按五级标准打分,直接扔掉 68% 的上下文,让后面那个贵的大模型少看很多无用信息。单次查询成本因此降了三分之一,同时答案所需资料的召回率维持在 96%。之前试过用重排序分数来砍,但分数在不同查询间没法对齐,也看不出资料块之间的关联,所以失败了。现在...
推荐理由:kapa.ai 这篇工程实践文章给了真实数字和与失败方案的对比,不是公关稿。我会先打个折:它只是一家公司的实践报告,不是协议更新或模型发布,所以传播面有限,但内容本身对从业者很实在。