约束 RL 新思路:延迟校正 Bellman 算子加因果归因做安全学习

No_Cauliflower7923 · reddit · 2026-08-24

作者提出 CCPL(Causal Consequence-Penalized Learning)框架,解决约束强化学习中违规后果存在随机延迟时「惩罚恰好在前面的动作而非真正原因动作」的问题。

作者招 constrained/safe RL 与因果推断方向的合作者。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →