RL训练通用倾向而非特定策略,模型价值由训练环境结构决定

novasarc01 · x · 2026-08-17

作者分享了对 Kimi 实验结果的思考。此前研究显示,在丰富的公共物品博弈中进行代理道德对齐训练,能显著迁移到语义无关任务(减少 OOD 任务中约 35% 的有害行为),而囚徒困境训练迁移性极差。

Kimi 的结果呈现出类似的镜像风味。这表明 RL 可能正在训练一种通用的倾向,而非针对特定游戏的策略。作者认为,我们可能低估了训练领域的战术战略结构对模型“价值观”的决定作用。随着 Kimi 在极简单游戏中发现证据,环境复杂度并非唯一关键,更重要的是环境能否反复奖励抽象规则。

所属事件:RL训练泛化道德倾向:公共品博弈有效,囚徒困境难迁移(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →