# UEmbed：一个模型同时输出稀疏和稠密两种多模态向量

> 原标题：UEmbed：统一稀疏与稠密的多模态嵌入模型

- 来源：AI HOT 精选
- 发布时间：2026-08-03T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48531
- 原文：https://arxiv.org/abs/2608.02583

## 摘要

UEmbed 用一个纯解码器模型，在一次前向推理里同时吐出两种向量：稀疏向量（像关键词匹配，但能学到语义）和稠密向量（纯语义压缩）。做法是在输入末尾加 N 个可学习的特殊 token，把整个词表切成 N 份，每个 token 只负责预测自己那份词表上的权重，最后拼成一个完整的稀疏向量。论文发了 2B、4B、9B 三个尺寸，都用公开数据训练。9B 版在 ...

## 推荐理由

这篇把稀疏和稠密嵌入塞进一个解码器模型，一次前向就出两种向量，对搜索和外挂资料库场景是实打实的简化。9B 模型基准分好看，但正文没披露推理延迟和实际部署情况，这点先别太激动——没落地数据，我只能打个折，给 featured 而不是 must-write。

## 锐评

UEmbed 把稀疏检索和稠密检索塞进同一个纯解码器模型里，一次前向推理就能拿到两种向量。做法挺取巧：在输入末尾加 N 个可学习的特殊 token，把整个词表切成 N 份，每个 token 只负责预测自己那份词表上的权重，最后拼出一个完整的稀疏向量。这样不用再单独维护一套稀疏编码器，对做搜索和 RAG 的团队来说，部署链路能简化不少。

9B 版本在 MMEB-v2 上稠密 71.8、稀疏 71.0，超过了同样用公开数据训练的 RzenEmbed，BEIR 上也跟强基线打得有来有回。论文还展示了在 agent 场景下的可用性，说明不只是刷榜。但正文没披露推理延迟和显存占用，这两个指标直接决定能不能在线上用。另外训练数据只说是公开数据，具体构成和规模没展开，复现和公平对比会有点麻烦。
