# OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

> 原标题：开源项目OpenSquilla：智能路由与本地检索，大幅降低LLM使用成本

- 来源：AI HOT 精选
- 发布时间：2026-05-14T02:55:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19936
- 原文：https://x.com/vista8/status/2054757474100760626

## 摘要

OpenSquilla 这个开源项目把模型路由决策放在本地跑，不花 token 就能判断问题难易：简单问题丢给便宜模型，复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩，还支持混合检索。正文没披露具体测试场景和模型阵容，所以这 90% 的降幅在什么任务上测出来的还不清楚...

## 推荐理由

我会先打个折：信息来自一篇 X 上的项目帖，仓库实际活跃度、测试环境和局限性正文都没披露，所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成，等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说，哪怕只实现一半效果也值得关注。

## 锐评

OpenSquilla 把模型路由这件事从云端搬到了本地，不花 token 就能判断问题难易，简单问题丢给便宜模型，复杂问题才上强模型。这个思路本身挺实在，等于在请求发出去之前先做一次分流，省掉了一部分不必要的推理开销。它还用增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下，记忆模块会在上下文快满时自动挑重点压缩，支持混合检索，功能堆得挺全。

但正文没披露具体测试场景和模型阵容，这 90% 的降幅是在什么任务上跑出来的、对比的是哪套模型组合，全都不清楚。如果测的是极端重复的对话场景，缓存命中率天然就高，数字会好看很多。另外路由决策本身虽然不花 token，但本地做判断的准确率怎么样，会不会把该上强模型的问题误判成简单问题，这点也没交代。

还缺的是跟现有方案的成本对比，比如跟直接全量走便宜模型、或者用云端路由服务比，到底省了多少。功能列得热闹，但没看到实际跑分和失败案例，暂时只能当个有意思的方向看。
