EAPO:熵引导 credit assignment,让 LLM 推理强化学习更会探索
coallaoh · x · 2026-09-29
wgcyeo 介绍新方法 EAPO(Entropic Advantage Policy Optimization),针对 RLVR 中「不确定下的成功难以复现、自信的失败容易复发」的问题,提出熵引导的 credit assignment,对成功与失败做非对称处理以促进探索:
- 强化意外成功:在高熵决策点上,对出乎意料的成功给予更强正反馈
- 加重重复失败的惩罚:在低熵决策点上对反复出现的失败施加更强惩罚
- 软化不确定决策的惩罚:保留备选路径,便于后续恢复
该方法无需辅助模型、token 级监督或大量额外计算,在多个推理 benchmark 上,无论 base 还是 reasoning backbone 都取得了最优或接近最优的整体成绩。
所属事件:EAPO 用熵引导信用分配提升 LLM 推理 RL 训练(2 条相关)→
「研究」频道最新
- BEEAR 论文移除 LLM 安全后门,作者提醒最坏情形下未必有效 — QuintinPope5 · 2026-09-29
- 灾难性遗忘真能抹掉微调出的坏行为吗?研究者质疑训练设置等效同时训练 — QuintinPope5 · 2026-09-29
- 眼睛约 100Hz 的眼球微震颤,或为视觉皮层实现超分辨率 — docmilanfar · 2026-09-29
- AI 从零设计病毒:斯坦福等合成 302 个噬菌体基因组,16 个有效 — CallRevolutionary894 · 2026-09-29
- Reddit 讨论:Softmax 输出仅 N-1 自由度,能否少一层参数? — Kinexity · 2026-09-29
- 让扩散模型故意塌缩:从预训练权重中提取人群图谱 — kwangmoo_yi · 2026-09-29