快手提出 DARA:多奖励 RL 训练步数最多省 65%,代码开源
kuaishou · hf · 2026-10-02
快手团队针对多奖励强化学习(RLHF 同时满足多个行为目标)中不同目标学习进度不均的问题,提出 Density-Aware Reward Aggregation(DARA),代码开源。
- 分析:通过 advantage energy(一批 rollout 中某奖励平方优势之和)证明:在理想化 GDPO 归一化下,该能量与「活跃组密度」(该奖励产生非零相对优势的 rollout 组比例)成正比,揭示残留的批次级信号失衡。
- 方法:推导出按密度倒数平方根的校正权重,给低频活跃奖励更大权重;权重逐 batch 自适应计算,不改动底层策略优化目标。
- 效果:在工具调用与数学推理任务上,DARA 比 GDPO 更快学会目标行为——工具调用格式合规最多少用 26% 训练步数,数学推理长度合规最多少用 65% 步数,最终性能持平。
「研究」频道最新
- Nature 封面:630 万核测序绘制人类前额叶最大基因活动图谱 — jiqizhixin · 2026-10-02
- 1.3微秒CPU检测幻觉:120B大模型反而集体自信胡编 — More_Slide5739 · 2026-10-02
- 18岁日本学生用MCMC研究折纸结构,拿下ISEF最高奖10万美元 — burny_tech · 2026-10-02
- 从视觉皮层到前额叶:用 Cover 定理解释『怪异』神经元 — burny_tech · 2026-10-02
- 自适应努力是动态循环 Transformer 的杀手级应用 — willcb · 2026-10-02
- 华科团队提出 Multimodal Flow:语言与视觉的全连续统一建模 — hustvl · 2026-10-02