KAIST 提出 EAPO:熵引导信用分配,强化意外成功、惩罚重复失败

kaist-ai · hf · 2026-09-29

KAIST AI 团队提出 Entropic Advantage Policy Optimization(EAPO),一种面向 LLM 推理 RLVR 训练的熵引导信用分配方法。现有细粒度信用分配方法常需辅助模型、额外采样或特权信息,EAPO 直接利用现成的 policy 熵信号。

核心观察:不确定性下的成功难以复现,而自信的失败倾向于重复出现。

方法设计

实验:在多种推理任务、base 与 reasoning 两种主干上取得最佳整体表现,并促进更有效探索——扩大问题覆盖、生成更多样候选答案。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →