RL训练泛化倾向:公共品博弈迁移35%,简单博弈无效(附LessWrong链接)

novasarc01 · x · 2026-08-17

作者在LessWrong上发布了关于智能体道德对齐的研究,指出在丰富公共品博弈中训练可迁移至语义无关任务(如降低分布外有害行为约35%),而简单囚徒困境训练迁移效果甚微。Kimi的类似结果与之镜像,表明RL训练的是泛化倾向而非特定策略。环境复杂度并非唯一关键,抽象规则反复奖励可能更重要。

所属事件:RL训练泛化道德倾向:公共品博弈有效,囚徒困境难迁移(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →