Perplexity 上线查询感知压缩,上下文 token 最多砍掉 70% 但回答质量反而更好
Perplexity 把一项叫“查询感知压缩”的技术用到了线上。它能在搜索时把喂给模型的上下文 token 最多减少 70%,同时回答质量还提升了。核心逻辑是“更好的上下文优于更多的上下文”,也就是先理解你问什么,再挑最相关的信息塞进窗口,而不是一股脑全丢进去。正文没披露具体测试基准和压缩方法细节,所以实际效果我会先打个折,但能省下这么多 token ...
推荐理由:我会先打个折:正文只给了一条 X 帖子,没放基准测试和可复现的设置,所以别太激动。但这条信息本身够硬——Perplexity 在生产环境用查询感知压缩,最多砍掉 70% 上下文令牌,同时回答质量还变好了。对搞外挂资料库和搜索优化的从业者来说,这直接关系到省钱和降延迟,值得看一眼。