跳到正文
AI HOT 精选

OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

开源项目OpenSquilla:智能路由与本地检索,大幅降低LLM使用成本

OpenSquilla 这个开源项目把模型路由决策放在本地跑,不花 token 就能判断问题难易:简单问题丢给便宜模型,复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩,还支持混合检索。正文没披露具体测试场景和模型阵容,所以这 90% 的降幅在什么任务上测出来的还不清楚...

推荐理由:我会先打个折:信息来自一篇 X 上的项目帖,仓库实际活跃度、测试环境和局限性正文都没披露,所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成,等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说,哪怕只实现一半效果也值得关注。

读原文 ↗导出 Markdown