Towards Faithful Simulation of Human Shopping Behavior
Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng
cs.IR
2026-08-21
阿里、人大与 NUS 提出 RecVerse,以截图、三层记忆和轨迹级 GRPO 模拟逛街,相对 STA 商品 F1 从 4.27 升到 7.19、HCO 从 23.11 到 32.64,人类评测仍有 74% 站真人。
电商要离线评推荐策略、给强化学习当环境,都需要一个像真人一样逛街的模拟器。规则模拟器动作空间太窄;LLM Agent 只看商品文本,看不见排版和图片;最近的 GUI 模拟器终于吃截图了,长会话仍然处理不好。
两个具体卡点。记忆:一次购物常常跨很多屏,扔掉历史就丢跨页比较,全塞进上下文又会把模拟质量拖下去。论文 Figure 1 显示视觉记忆片段加到中等长度之后准确率开始掉,token 成本还在涨。优化:现有方法几乎都在逐步模仿下一条日志动作。真实浏览有误滑再退回这种噪声,逐步拟合会把噪声学进去;逐步监督也看不出整段会话是不是点太勤或太懒。RecAgent 的加购率到 80.09%,Agent4Rec 到 55.09%,真人只有 15.93%。意图指标会被「瞎点」撑起来。
RecVerse 是 GUI 接地的模拟 Agent,观测是页面截图,输出多轮轨迹。骨干是 Qwen3.5-2B,视觉编码器冻结,全参微调。先模仿学习热身,再用 GRPO 做轨迹级强化学习。
记忆做成三层,更新本身也是动作,和点击、滚动一起被 RL 训练,而不是手写何时写入。
奖励拆成三块。宏观奖励惩罚整段会话里点击、加购、购买等商品向动作次数相对真人轨迹的相对偏差,把过探索和过被动压下去。微观奖励按三级类目共享前缀给分,购买权重大于点击,不要求 SKU 完全命中。再加一个格式奖励,输出要能解析、动作要能在当前界面执行。模仿学习数据用 Qwen3.5-397B-A17B 对真实轨迹做反事实重建,补出心思和记忆更新;原始动作长尾,用 α=0.3 的幂律平滑重采样,避免策略塌成只会往下滚。
同时放出 USB:东亚某大型电商 5,274 条真实 GUI 轨迹,69,842 步,8 类动作,90,095 件商品,三级类目 41/517/2,256,5,222 个用户。论文称这是同时具备截图轨迹、多样动作、用户画像和可交互环境、能做多轮 Agent RL 的用户模拟基准。
真人参考:平均轨迹长 13.47 步,CTR 9.08%,加购率 15.93%,转化率 13.54%,进详情页率 29.60%。
RecVerse-GUI 加 RL:轨迹长 16.25,CTR 7.78%,加购 19.99%,转化 4.87%,进详情 32.86%。商品级 F1 7.19、命中率 10.45、层次类目重合 HCO 32.64。最强 GUI 基线 STA 是 F1 4.27、HR 5.92、HCO 23.11。文本版 RecVerse 即使上 RL,HCO 也只有 24.38,截图本身有增量。
过交互的 RecAgent 和 Agent4Rec 类目分更高,加购和转化远高于真人,论文把它们标成行为失真,不参与行为可比较方法里的加粗。人类 pairwise 里,相对 STA,评测员 92% 更像 RecVerse;相对真人,仍有 74% 站真人。Fleiss κ 为 0.834。微观奖励系数 λ=1000 时意图最强,轨迹长度偏差也到 2.78 步。换 Qwen3.5-4B,类目指标从 30% 出头升到 40% 以上,转化率更接近真人,进详情页率反而偏低。类目匹配比严格 SKU 命中更适合当 RL 信号:F1 从 4.90 到 7.19,HR 从 6.51 到 10.45。
推荐离线评和 Agent 式推荐训练缺的就是一个不太会刷指标的用户环境。这篇把过程导向的逛街和任务导向的 GUI Agent 切开:前者要复现比较、犹豫、乱滑,而不是完成「买到 X」。把写记忆当成可学习动作、用整段会话而不是下一步正确与否来打分,对别的长程 GUI 模拟也用得上。
从业者别把「显著优于基线」读成能上线。商品级 F1 7.19 意味着精确命中仍很低,转化率 4.87% 对真人 13.54% 差一截。更接近「看起来会逛」,还远不是「可以当真人流量」。USB 声称可交互,数据和环境来自单一市场,外部能不能复现要另说。
作者自己写了:人类评测和真人仍有明显差距,需要更深的个性化。转化率对不齐、λ 调大意图涨但轨迹变长,说明宏观和微观奖励在打架。微观奖励用的是参考轨迹里的类目,不是独立的用户意图标注,有把会话标签泄漏进奖励的味道。训练和推理轨迹截断 20 步,真人平均约 13 步,但引言里「几十屏」的设定并没有在训练里完全展开。视觉编码器冻结、主实验只有 2B,4B 结果在图里、表上不全。USB 来自未具名的东亚大盘,交互环境是否对外可跑,正文没有给出可核查的开放程度。