EAPO 用熵引导信用分配提升 LLM 推理 RL 训练

KAIST AI 团队提出新方法 EAPO(Entropic Advantage Policy Optimization),面向 LLM 推理的 RLVR 训练,通过熵引导的信用分配机制,针对「不确定下的成功难以复现、自信的失败容易复发」的问题,强化意外成功的样本、惩罚重复失败,让强化学习在推理训练中更善于探索,提升训练效果。

2026-09-29 ~ 2026-09-29 · 2 条相关

另有 1 条近重复转述:coallaoh