快手提出 DARA:多奖励 RL 训练步数最多省 65%,代码开源

kuaishou · hf · 2026-10-02

快手团队针对多奖励强化学习(RLHF 同时满足多个行为目标)中不同目标学习进度不均的问题,提出 Density-Aware Reward Aggregation(DARA),代码开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →