RL 中的局部坏行为不会泛化出「涌现性错位」

1a3orn · x · 2026-09-09

延续其线程,1a3orn 援引 hacker-opus 的观察称:LLM 在 RL 训练中「看到自己」做坏事的局部经历,目前并不会涌现出全局性的 misalignment——坏行为在局部发生,却不泛化为全局坏行为。

所属事件:RL 局部行为难泛化:好与坏都不会成全局人格(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →