通用多模态嵌入正在从单一检索组件,走向推荐、分类和智能体系统的基础能力。腾讯发布的WeMM-Embedding技术报告给出了一套面向实际业务的模型家族:它试图把异构内容映射到共享空间,并支持不同输出维度,模型权重与代码也已公开。
覆盖多种输入形态
WeMM-Embedding支持文本、图像、视频、视觉文档,以及任意交错的多模态输入。这一点比只处理图文对的嵌入模型更贴近真实应用:用户内容往往不是单一模态,文档中也可能同时包含文字和图片。报告没有把模型限定在某一种下游任务,而是将检索、推荐、分类和智能体系统都视为通用嵌入的应用方向。
模型家族包含2B、4B和9B三个规模。训练分为两个阶段:第一阶段进行大规模多模态对齐,第二阶段使用人工筛选的数据、更细粒度的相关性监督,以及跨规模知识迁移进行精炼。这样的训练安排,重点不只是让不同模态进入同一空间,也包括改善嵌入对相关性差异的表达能力。
评测与业务落地
在公开评测中,WeMM-Embedding在多个基准上取得领先表现。报告特别指出,2B版本已经超过此前表现领先的8B开源基线,并在MMEB-v2上取得优势;9B版本则将整体得分推至80.6,达到新的最优水平。材料没有进一步说明各任务的单项得分,因此更适合把这些结果理解为模型家族在公开综合评测中的整体竞争力。
报告还给出了微信业务侧的结果:在26项内部基准上取得明显收益,并在14项线上A/B测试中持续改善。模型已经规模化部署到推荐和搜索应用,覆盖微信视频号、公众号、朋友圈以及电商服务。对于嵌入模型而言,这些信息说明它不只停留在离线实验,也被用于实际内容分发与检索链路。
我的判断
WeMM-Embedding的价值在于把多模态统一表示、模型规模选择和业务部署放进了同一套方案中。2B版本的结果尤其值得关注,它表明更大的参数规模并不自动等于更强的公开评测表现。不过,报告提供的结论主要来自给定的公开基准、内部基准和线上测试,尚不足以证明模型在所有领域或所有多模态任务上都占优。使用者仍需结合自身数据分布、延迟约束、输出维度需求和部署成本做选择。权重与代码开放,有利于开发者进一步复现和评估,但具体效果仍取决于下游场景。