EAPO 用熵引导信用分配提升 LLM 推理 RL 训练
KAIST AI 团队提出新方法 EAPO(Entropic Advantage Policy Optimization),面向 LLM 推理的 RLVR 训练,通过熵引导的信用分配机制,针对「不确定下的成功难以复现、自信的失败容易复发」的问题,强化意外成功的样本、惩罚重复失败,让强化学习在推理训练中更善于探索,提升训练效果。
2026-09-29 ~ 2026-09-29 · 2 条相关
- KAIST 提出 EAPO:熵引导信用分配,强化意外成功、惩罚重复失败 — kaist-ai · 2026-09-29
另有 1 条近重复转述:coallaoh