EAPO:熵引导 credit assignment,让 LLM 推理强化学习更会探索

coallaoh · x · 2026-09-29

wgcyeo 介绍新方法 EAPO(Entropic Advantage Policy Optimization),针对 RLVR 中「不确定下的成功难以复现、自信的失败容易复发」的问题,提出熵引导的 credit assignment,对成功与失败做非对称处理以促进探索:

该方法无需辅助模型、token 级监督或大量额外计算,在多个推理 benchmark 上,无论 base 还是 reasoning backbone 都取得了最优或接近最优的整体成绩。

所属事件:EAPO 用熵引导信用分配提升 LLM 推理 RL 训练(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →