NeurIPS 论文:Newcomb 类环境中 RL 智能体可能无法收敛到最优策略

jessi_cata · x · 2026-09-16

jessicata 在讨论决策理论(EDT/CDT)与强化学习结合时,引用了 Bell、Linsefors、Oesterheld、Skalse 的 NeurIPS 2021 论文《Reinforcement Learning in Newcomblike Environments》。论文要点:

作者补充提到该文测试了 GRPO,但理论更支持 CDT 自批准(self-ratification),并指出策略优化问题与 KKT 条件可依赖于策略本身,从而可以把自批准机制包裹进去。这是把决策理论与 RL 训练动力学连接起来的重要理论工作。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →