中科大与阿里提出 PARPO,把用户个性化偏好引入 Agentic RL 训练
量子位 · wechat · 2026-09-13
中国科学技术大学与阿里巴巴集团研究团队提出 PARPO(Personalized Anchor Reward-Decoupled Policy Optimization),把个性化正式纳入 Agentic RL 的训练期优化目标,论文主题为「从正确性到偏好」。
核心问题
- 电商助手、旅行规划等场景中同一 query 的最优轨迹因用户而异,只优化通用任务完成度会让模型学成「平均用户喜欢的样子」
- 论文归纳三大挑战:个性化奖励含义不清、真实偏好与从众/流行度信号混杂、扁平记忆难以表达用户-技能-工具-场景关系
方法:三部分闭环
- PSGM 记忆:以 User/Skill/Tool/Scenario/Trajectory 五类节点构建异构图,检索时沿「技能-用户-同源技能」扩展,综合相关性、互补加成与冲突惩罚排序
- 两阶段偏好奖励模型:多视角画像缓解冷启动,再用 LightGCN 在用户-物品交互图上分离「兴趣」与「从众」两个正交分支,提取更干净的偏好信号
- PARPO 优化器:将通用任务质量与个性化偏好分成两条 advantage 轨道,个性化分支用指数移动平均维护用户级历史锚点,与该用户自己的历史中心而非全量均值比较
结果
- 在 ETAPP、ETAPP-Hard 和商家决策场景 SJAgent 上评估(Qwen3-4B/8B):ETAPP 上 8B 模型 Judge 分数 0.8333,SJAgent 上 Reward 0.8270,全面超过 ReAct、GRPO、DAPO、GSPO、GiGPO、MemRL、SkillRL
- 15 位人类专家与 4 组 LLM judge 盲测中均排名第一,最大优势在 User Relevance 维度
- 消融显示去掉技能记忆后 Judge 从 0.7708 降至 0.7006,是最大降幅;用户锚点与兴趣/从众分支同样缺一不可
作者也指出局限:人工盲测规模有限,兴趣-从众解耦是操作层面而非严格因果分离。
「研究」频道最新
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- 开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新 — YouJiacheng · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14