DREAM Technical Report
Bin Zhang, Bowen Zheng, Chao Yi, Chengyu Lai, Dian Chen, Dimin Wang, Gaoyang Guo, Jialin Zhu, Jian Wu, Jing Yu, Jiuning Lin, Lingqing Zhang, Lingyun Zheng, Mao Zhang, Mingming Pan, Ruiquan Lan, Shuai Zhong, Wen Chen, Wendong Zhang, Xiaodong Zhu, Xuan Chen, Xunke Xi, Yifan Lu, Yiheng Wang, Yue Zeng, Yujie Luo, Yuning Jiang, Zhe Hu, Zhibo Xiao, Zihong Huang, Binbin Cao, Bo Zheng, Danning Wang, Dixuan Wang, Ge Fan, Haixia Wu, Han Zhu, Hao Fang, Haoming Chen, Huiping Chu, Jian Wang, Jianjun Wu, Jiawei Wu, Jiaxin Yu, Jingwen Liu, Jinzhe Shan, Kai Meng, Kai Zhang, Keqin Xu, Kewei Zhu, Lang Tian, Leihui Chen, Li Chen, Licheng Xu, Lide Xiao, Ruitong Zhang, Shiyao Peng, Silu Zhou, Tao Wang, Wei Shi, Wenjun Yang, Xiang Chen, Xiang Gao, Xiao Ren, Xu Liu, Xuwen Wang, Yang Li, Yeqiu Yang, Yi Hu, Yichen Yuan, Yinnan Song, Yipeng Yu, Yuan Liu, Yunqi Gao, Zhiliang Huang, Zhujin Gao, Zongyuan Wu
cs.IR
2026-08-10
阿里DREAM在现有召回-排序-重排上叠意图引擎与元策略层,上报量压到约8.7%且不替换原模型;重排控制使IPV+2.06%、Core IPV+2.39%、GMV+0.88%,扩到精排后为+2.71%、+3.06%、+1.31%。
工业推荐仍是召回、排序、重排的级联管道。模块稳、延迟可控,但信息在级间断开,点击、转化、体验各优化各的,策略多半是静态规则,会话里从浏览切到比价再切到下单,管道几乎看不见。
近年的Agent推荐多半只做其中一段:用记忆选商品、用Agent模拟用户、对话式推荐,或改系统架构。缺的是一条能同时感知实时意图、生成跨模块策略、再把执行结果喂回上游的控制面。DREAM(Developing Recommender Engine with Agentic Methods)的选择是叠一层,不换现有模型。
两块引擎加一条双环。
意图引擎把端上和云上的行为收成三级结构:L0画像(稳定属性)、L1需求(类目与场景)、L2偏好(品牌、价格、决策阶段、实时心态)。设备侧F1到F3用轻量GRU做变点检测,约15%的行为打成ID编码包上传;云上F4补语义后再决定是否调用推理。摘要给出的整条漏斗上报量约8.7%。在线主路径是0.8B的Main Agent,只输出意图列表的增量插入和更新;约6.3%的请求异步交给4B的上下文子Agent或专家,再用on-policy蒸馏把 refinement 收回主模型。夜间低峰用4B做Dreaming,对全天轨迹执行保留、纠正、补全、合并、新增、删除六种操作,用完整列表替换白天攒下的增量状态。
元引擎的MetaModel基于Qwen3,近线做三层推理:M1把意图收成IPV导向或GMV导向的总方向,M2吐出六模块的枚举JSON(目标加权、业务保护、类目与卡片类型偏好、体验约束、位置策略),M3是确定性编译,把语义动作翻成排序服务能吃的有界参数。请求时只读缓存做局部覆盖,缺包、过期、越界一律回落到默认配置。安全护栏管范围、白名单和流量上限。
奖励双环把探索和校准拆开。离线用Evaluator对日志请求重放,策略只有在平均分超过默认定制时才拿正奖励,训练信号是二元的。在线用真实IPV、CVR、GMV回写策略记忆。LLM不走延迟关键路径。
淘宝首页「猜你喜欢」上,控制面从重排扩到精排,相对线上基线的相对提升如下(绝对值因保密未公布):
| 配置 | PV | IPV | Core IPV | GMV | PCTR |
| 只控重排 | +1.03% | +2.06% | +2.39% | +0.88% | +0.76% |
| 重排+精排 | +1.04% | +2.71% | +3.06% | +1.31% | +1.25% |
两档的PV几乎一样,更深一层赚的是同一曝光里的点击和转化。意图引擎单独接到下游时,认知推荐全站IPV +0.80%、Core IPV +0.91%;策略适配IPV +0.52%、PCTR持平(-0.02%)。启发式推荐场景内,询卡点击分别+7.17%和+10.64%。
意图模型用后续行为做LLM评判:基线总分71.32,加路由78.20,再加自进化84.74;搜索词召回从50.57%到56.05%。Dreaming在683个配对用户上,意图类型从0.583到0.680,子类目从0.477到0.523。离线4B回放RL相对同尺寸Base:pCTR +2.42%、pIPV +1.38%、pGMV +0.37%、pCVR -0.99%,策略可执行率从80.86%到98.85%。
对已经有稳定级联管道的团队,这条路比「用Agent重写推荐」更可落地:旧模型继续扛流量,Agent只改有界旋钮,默认回落保命。端云漏斗把上报压到一成以下,0.8B扛实时、4B夜里做梦,成本模型说得通。淘宝首页能同时抬IPV和GMV,说明元控制至少在这一场景不是零和。
增益是在很强的生产基线上再抠一到三个点。换到没有端上行为包、没有重排旋钮的系统,数字不会原样出现。
论文没有独立的局限节,要自己把账算清。在线只给相对提升,流量规模、显著性和置信区间都不在表里。意图质量高度依赖LLM-as-a-Judge,且丢掉后续行为不足的样本,容易偏向好说话的用户。8.7%的上报量写在摘要里,正文只明确了F2约15%,整条漏斗的乘法关系没有单独成表。离线重放承认无法复原当时服务状态,二元奖励也不区分「赢一点」和「赢很多」。MetaModel在线用的具体尺寸、和Qwen3哪一档对齐,A/B表没有写死。端上微信号是淘宝客户端特供,搬到别的App要重做感知层。控制面再宽,天花板仍是底下那条排序管道。