工业推荐系统正在采用“预训练后迁移”的范式,但用户行为持续变化,预训练模型需要反复刷新。问题在于:行为序列中哪些关系值得学习,以及更新预训练知识时,怎样避免破坏已经完成的下游适配。论文提出 Knowledge-Geometry Decoupling(KGD),从监督目标和参数归属两个层面处理这组矛盾。
从相邻预测转向相关行为预测
传统的下一 Token 预测默认相邻行为存在依赖,容易把不同会话之间偶然相邻、实际无关的商品转移也编码进模型。KGD 引入 Behavioral Multi-Token Prediction(BMTP),不再把所有后续商品都作为同等有效的监督,而是仅保留具有协同关系或语义关系的未来商品。
论文将其目标概括为获得更干净、也更容易迁移的行为知识。这里的重点不是单纯扩大预测范围,而是筛选监督信号,降低行为序列中伪转移对预训练表示的影响。
把知识刷新与任务适配分给不同参数
KGD 认为,预训练知识与任务特定的表示几何会对共享参数提出冲突的优化要求。为此,它让可刷新的编码器负责保存行为知识;下游任务学习器通过只读交叉注意力读取编码器产生的上下文化状态,任务梯度不反向干扰编码器。
任务侧再通过 Anchored Calibration Residual(ACR)写入特定几何,并使该残差与预训练嵌入正交。这样的参数所有权划分,使编码器可以持续刷新,同时尽量不让已有的下游适配失效。论文报告,KGD 在八个公开基准上较强预训练迁移基线提升 4%—12%;在持续 90 天的生产数据流中仍保持优势,而对比基线没有获得收益。该方法已完整部署于 Shopee。
我的判断
KGD 的价值不只是一项推荐精度改进,而是给频繁更新的预训练推荐系统提供了较清晰的工程边界:知识可以刷新,任务适配则尽量保持稳定。它尤其适合行为分布变化快、同一预训练模型服务多个下游任务的场景。
不过,现有材料没有给出 BMTP 关系筛选、ACR 计算成本及线上 A/B 测试结果的完整细节,也无法判断提升分别来自监督清洗还是参数解耦。对于漂移较弱或无需持续刷新模型的系统,这套结构增加的复杂度是否值得,仍需结合消融实验与实际维护成本评估。