RL训练泛化道德倾向:公共品博弈有效,囚徒困境难迁移

研究者在LessWrong结合Kimi实验结果指出,RL训练学的是通用倾向而非特定策略:在丰富公共物品博弈中做道德对齐训练可迁移到语义无关任务,让分布外有害行为减少约35%,而简单囚徒困境训练迁移甚微,训练环境结构决定模型价值。

2026-08-17 ~ 2026-08-17 · 2 条相关