RL训练泛化道德倾向:公共品博弈有效,囚徒困境难迁移
研究者在LessWrong结合Kimi实验结果指出,RL训练学的是通用倾向而非特定策略:在丰富公共物品博弈中做道德对齐训练可迁移到语义无关任务,让分布外有害行为减少约35%,而简单囚徒困境训练迁移甚微,训练环境结构决定模型价值。
2026-08-17 ~ 2026-08-17 · 2 条相关
- RL训练通用倾向而非特定策略,模型价值由训练环境结构决定 — novasarc01 · 2026-08-17
- RL训练泛化倾向:公共品博弈迁移35%,简单博弈无效(附LessWrong链接) — novasarc01 · 2026-08-17