# Perplexity 开源 Unigram 分词器，CPU 占用降了五六倍

> 原标题：Perplexity开源Unigram分词器降低CPU占用

- 来源：AI HOT 精选
- 发布时间：2026-05-27T15:55:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28749
- 原文：https://x.com/perplexity_ai/status/2059664738087469511

## 摘要

Perplexity 把自家重写的 Unigram 分词器开源了，放在 pplx-garden 仓库里。这个分词器主要解决一个实际问题：现在小型的重排序模型和嵌入模型在 GPU 上跑一次只要几毫秒，但 CPU 分词那一步反而成了拖后腿的环节。他们这次重构后，CPU 占用直接降了 5 到 6 倍，等于把分词这步的延迟砍掉一大截，让整体响应更快。正文没提具...

## 推荐理由

我会先打个折：正文没给独立基准测试、代码仓库细节和实际部署规模，所以 5-6 倍这个数字先别太激动。但分词器确实是重排序和嵌入模型里容易被忽略的 CPU 消耗大户，Perplexity 把这块开源出来，对跑生产 RAG 和搜索管线的团队来说，省下来的算力就是省下来的钱。

## 锐评

这条开源消息的实用价值很直接。现在很多重排序和嵌入模型在 GPU 上推理只要几毫秒，但文本进模型前得先在 CPU 上做分词，这一步反而成了延迟大头。Perplexity 重写了 Unigram 分词器，把 CPU 占用降了 5 到 6 倍，等于把管道里最慢的那段修了。代码放在 pplx-garden 仓库，可以直接拿去用。

不过正文没披露具体是怎么改的，也没给基准测试的硬件环境和延迟数字。5-6 倍是 CPU 占用下降，不是端到端延迟下降，实际能省多少时间还得看你的模型和部署方式。另外只提了小型重排序和嵌入模型，对大模型的分词有没有同样效果，没说。

我会先打个折：如果你们管线里分词确实是瓶颈，这个值得试；如果不是，就别指望它能救整体延迟。
