用户表征学习通常沿着三条路径扩展:增加用户数量、拉长行为序列,以及扩大模型规模。但在真实工业场景中,原始文本行为数据并不是越多越有效。论文围绕十亿级容量场景,提出一条“用户行为稠密化规律”,试图回答一个更具体的问题:面对不同规模的输入数据,分词配置至少需要多大,才能持续获得足够收益。

原始数据扩展的瓶颈

论文首先在十亿级支付宝数据集上比较原始行为数据与分词后的扩展效果。结果显示,随着原始文本用户行为输入规模扩大,模型性能会出现收益递减,单纯继续增加原始数据,可能逐渐触及数据表示方式本身的瓶颈。分词提供了另一条扩展路径:它能够在数据规模继续增长时维持收益,因此论文将分词视为缓解原始数据扩展瓶颈的关键配置。

这里的重点不只是“是否分词”,而是分词容量应该如何随数据规模变化。若容量配置过小,可能无法充分承载更大规模行为数据;若配置方式缺乏依据,也难以判断新增容量是否真正必要。

一条关于容量的尺度规律

为描述这种关系,论文结合理论分析与系统实验,研究不同数据规模下的最小充分分词配置。其核心发现是:最小充分分词容量的对数,与以 token 数量衡量的输入数据规模的对数之间,大致呈线性关系。换言之,分词容量并非需要与数据规模简单同比增长,而是存在一种可量化的尺度关系。

这条关系的斜率并不固定,而会随分词方法和数据源系统性变化。论文将差异归因于表示空间中的冗余程度,以及同一数据源内部的独特性。不同来源的用户行为数据,可能需要不同的容量增长策略,因此不能直接把某一数据集上的配置经验平移到所有场景。

在此规律的指导下,论文进一步开发了 ALGN,一种自适应的可变……材料未提供该方法的完整名称、机制与实验细节,因此这里只能确认它是对上述容量规律的进一步应用,不能据此判断其具体收益。

我的判断

这项工作的价值,在于把用户表征扩展中的经验配置问题,转化为一个可分析的尺度问题。对于需要处理大规模用户行为数据的工业系统,最小充分分词容量这一概念,有助于减少盲目堆叠原始输入,也为容量规划提供了更明确的研究方向。

但这条规律目前应被理解为一种近似关系,而不是跨场景通用的固定公式。论文摘要明确指出,斜率会受到分词方法和数据源影响,说明实际部署仍需要重新评估。材料也没有给出具体斜率、数据规模、性能增益或 ALGN 的实验结果,因此还不足以据此制定工程配置标准。它更适合作为大规模用户表征系统中的分析框架和实验假设,而不是脱离数据源直接套用的结论。