约束 RL 新思路:延迟校正 Bellman 算子加因果归因做安全学习
No_Cauliflower7923 · reddit · 2026-08-24
作者提出 CCPL(Causal Consequence-Penalized Learning)框架,解决约束强化学习中违规后果存在随机延迟时「惩罚恰好在前面的动作而非真正原因动作」的问题。
- 延迟校正 Bellman 算子:从后果延迟分布自适应学习有效折扣因子,在未知随机延迟下仍保持收缩性证明。
- 干预后果网络(ICN):在结构因果模型标签上预训练,估计每个动作的边际因果贡献,用因果归因替代时间邻近性惩罚。
- 局限:ICN 目前需要环境结构因果模型来生成预训练标签,无法端到端从观测/干预数据学习,在 SCM 未知的场景适用性受限。
作者招 constrained/safe RL 与因果推断方向的合作者。
「研究」频道最新
- ToMoE 论文:无需微训即可将稠密模型转为 MoE — pmttyji · 2026-08-24
- dots3-note 演示长周期任务规划能力 — rohanpaul_ai · 2026-08-24
- dots3-note 模型发布:16B 活跃参数专注长程任务 — rohanpaul_ai · 2026-08-24
- Nature研究:空气污染每年关联全球超千万癌症病例 — EricTopol · 2026-08-24
- DeepSeek V4 Flash 解析 ARC-AGI 任务,公开原始推理轨迹 — mhmazur · 2026-08-24
- OpenAI 内部模型协助发现 Lean 内核缺陷并已修复 — RexDouglass · 2026-08-24