中科大与阿里提出 PARPO,把用户个性化偏好引入 Agentic RL 训练

量子位 · wechat · 2026-09-13

中国科学技术大学与阿里巴巴集团研究团队提出 PARPO(Personalized Anchor Reward-Decoupled Policy Optimization),把个性化正式纳入 Agentic RL 的训练期优化目标,论文主题为「从正确性到偏好」。

核心问题

方法:三部分闭环

结果

作者也指出局限:人工盲测规模有限,兴趣-从众解耦是操作层面而非严格因果分离。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →