稀疏检索支撑着网页搜索和检索增强生成,但学习式稀疏检索长期依赖双向编码器,多模态扩展也往往需要额外的跨模态模块。UEmbed 尝试改变这一架构边界:让一个仅解码器多模态模型在一次因果前向中,同时产出稀疏词法表示与稠密表示。

一次前向如何生成两类表示

UEmbed 会在输入末尾追加 N 个可学习的特殊 token,并将完整词表划分为 N 个互不重叠的子集。每个特殊 token 对应一个子集,其因果隐藏状态负责预测该子集内的稀疏权重;最后再把 N 组结果拼接为完整稀疏向量。

这种设计的关键不只是增加特殊 token,而是把原本依赖双向编码器的稀疏表示学习,放进了解码器式因果计算流程。与此同时,模型仍能生成稠密表示,因此文本与多模态输入、稀疏与稠密检索可以由同一模型处理。论文基于公开数据训练,并发布 2B、4B 和 9B 三种规模。

评测结果与应用范围

在 MMEB-v2 上,UEmbed-9B 的稠密表示得分为 71.8,稀疏表示得分为 71.0,超过了使用公开数据训练的多模态嵌入模型,例如 RzenEmbed。在 BEIR 上,它与较强的稠密、稀疏基线相比也保持竞争力。

论文还从效果、效率和智能体应用三个维度展示其实用性。不过,现有摘要没有给出各维度的具体实验配置和数字,因此暂时不能据此判断真实部署中的延迟、吞吐、索引体积或成本优势。两个分数也应分别理解为稠密与稀疏表示的评测结果,而不是二者融合后的统一成绩。

我的判断

UEmbed 的主要价值是架构统一:同一个仅解码器模型既覆盖多模态输入,又提供两种检索表示,可能减少分别维护稀疏模型、稠密模型及跨模态模块的复杂度。它对需要在语义召回与词法匹配之间灵活选择的搜索、RAG 和智能体系统尤其值得关注。

但适用边界仍需更多证据。当前材料只明确给出 MMEB-v2、BEIR 的概括性结果,且领先结论限定在使用公开数据训练的多模态嵌入模型范围内。稀疏向量的实际稀疏度、索引开销,以及不同模型规模下的效率收益均未披露。现阶段更适合把 UEmbed 看作一个有说服力的统一建模方向,而不是已经证明可以全面替代现有双塔或专用稀疏检索系统的方案。