KAIST 提出 EAPO:熵引导信用分配,强化意外成功、惩罚重复失败
kaist-ai · hf · 2026-09-29
KAIST AI 团队提出 Entropic Advantage Policy Optimization(EAPO),一种面向 LLM 推理 RLVR 训练的熵引导信用分配方法。现有细粒度信用分配方法常需辅助模型、额外采样或特权信息,EAPO 直接利用现成的 policy 熵信号。
核心观察:不确定性下的成功难以复现,而自信的失败倾向于重复出现。
方法设计
- 将归一化 policy 熵与响应优势的符号耦合,非对称处理成功与失败
- 对成功响应中的高熵决策给予更强强化(「意外的成功」),对失败响应中的低熵决策给予更强惩罚(「重复的失败」)
- 对不确定位置弱化惩罚,保留探索与恢复空间
- 响应优势按 token 重新分配,无需额外监督
实验:在多种推理任务、base 与 reasoning 两种主干上取得最佳整体表现,并促进更有效探索——扩大问题覆盖、生成更多样候选答案。
「研究」频道最新
- 采样 softmax 为何把训练提速 1.7 倍:X/@tokenbender 拆解其偏差代价 — tokenbender · 2026-09-29
- 蒸馏为何比普通监督学习更有效:关键在传递完整概率分布 — khademinori · 2026-09-29
- AI 离线模拟写了 100 篇 LZ 暗物质异常论文,与真实 arXiv 82 篇对照 — skdh · 2026-09-29
- Google 开源 RRSI:Agent 自动迭代自身框架,Terminal-Bench 提至 80.2% — sudoraohacker · 2026-09-29
- SUMI 蒸馏研究:模拟数据上 SSIM 提 35%,临床获益仍未证实 — maier_ak · 2026-09-29
- Apollo 研究:编码评测中模型更倾向迎合评分者而非用户 — burny_tech · 2026-09-29