支付宝行为扩到三千万用户就饱和,ALGN少用码还更高分

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

cs.IR, cs.AI

2026-08-24

蚂蚁在支付宝账单上测出,用户量过三千万、窗口过六十天,原始行为表征就饱和。变长分词ALGN只用RQ-VAE六成容量,分类AUC提到76.43。

这篇在解决什么

工业界给用户做统一表征,惯用三板斧:加用户、拉长历史、加大编码器。支付宝账单这类日志有个坏性质,日常消费高度重复,数据量涨得快,对下游真正有用的新信息涨得慢。

蚂蚁 DeepFind 和浙大把这件事放在十亿级容量的生产数据上测清楚了。用户量过约 0.03B、窗口过约 60 天、编码器过约 0.2B 参数,分类探针几乎不再动。更大的模型还能把预训练对比损失压下去,线性探针精度却停住。限制项不是参数个数,是原始行为序列里每个有效输入单元带走的任务相关信息。

方法

预训练把每个用户的行为切成过去和未来两段。Transformer 编码器吃过去,LoRA 微调的 Qwen3-Embedding 吃未来文本模板,InfoNCE 对齐。下游冻住编码器,做三类探针:分类 50 套、文本检索和用户对用户检索各 22 套,每套约 50 万用户,覆盖偏好、风控、营销。

对付密度,他们先用 RQ-VAE 把长账单压成固定长度离散码。多层残差里,前几层抓消费大类和固定套路,后几层补商户级偏好。同一套用户编码器,只把输入从原文换成离散码,用来隔离「变密」和「换模型」。

「刚好够用的分词容量」被写成一条经验关系:最小充分容量的对数,与数据规模(用户数、窗口长度)的对数近似线性。斜率跟着方法和数据源变。VQ-VAE 最高,因为它把相近语义存成多份完整码;RQ-VAE 居中,靠组合复用;SARQ 最低。同一方法下,斜率还跟数据源内部独特性的平方大致成比例,独特性用 LLM 文本嵌入的平均 k-NN 余弦距离来量。

再往下是实例级分配。ALGN 在每一层残差上用两个信号决定要不要继续加码:残差范数(还没解释完多少)和路径不确定性(当前语义有多含糊)。门控概率随残差和不确定性升,随边际码成本降。长度先验用 γ=0.3 的几何分布,避免所有样本都走到最大深度。

结果

原始扩展的饱和点很硬。用户从 0.01B 加到 0.03B 还有收益,再到 0.1B 几乎原地踏步。窗口从 30 天拉到 60 天有效,60 到 120 天几乎白加。编码器从 0.05B 加到 0.2B,探针变好;再到 0.4B,训练损失继续降,下游精度不动。预训练对比损失从约 8.28 只降到 8.15,窗口超过 90 天的曲线几乎叠在一起。

离散化之后,优势出现在原文已经饱和的区域:窗口大约 64 天、用户大约 1.2×10^7 之后,token 曲线开始甩开原文。账单上配好的压缩配置直接搬到 SPM 和小程序,AUC 还能保住约 95.0% 和 97.5%。

ALGN 的主对比固定在 180 天、0.1B 用户的账单分类:

方法容量AUCKSAcc
RQ-VAE100%74.5639.0282.44
SARQ76.24%75.3641.2883.16
ALGN63.47%76.4343.3183.52

相对最强基线 SARQ,ALGN 多 1.07/2.03/0.36 个点的 AUC/KS/Acc,容量再省 13.23 个百分点。它把 densing 斜率压到大约 0.59。

为什么重要

做推荐和风控的人如果还在靠「再加半年日志、再加一倍参数」,这篇给出的建议很具体:过了那几个阈值,钱花在 tokenizer 配置上更划算。定律校准一次之后,可以用轻量统计估下一档数据该配多大码本。ALGN 把同一原则落到每段行为:套路少给码,含糊的多给码。

这是工业数据上的渐进改进加一条可操作配方,不是新的通用 scaling law。公开基准还没交差。

局限与存疑

作者自己写了:实验主要落在支付宝单一平台、单一模态,视频消费这类行为还没验;公开数据集上的复现仍在进行。原文扩展实验的用户量只到 0.1B,离记号表里写的 2B 还差一截。token 化对比图给出了交叉点,正文没有把各尺度的绝对 AUC 写成表。ALGN 的主表只报了账单分类,检索任务被一句「趋势类似」带过。把 ln C 和 ln s 的线性关系叫定律,更接近拟合配方,换平台后斜率要重标定。

术语

原文与代码

社区讨论

相关论文

全部论文解读