RL 局部行为难泛化:好与坏都不会成全局人格
1a3orn 延续线程指出,RL 训练中「看到自己」做坏事的局部经历目前并不会涌现出全局性错位(misalignment)。他进一步给出对称推论:由于「好」与「坏」本是人造标签,同样的逻辑反过来也成立——RL 中的局部好行为同样不会泛化为全局性的好行为。
2026-09-09 ~ 2026-09-09 · 2 条相关
- RL 中的局部坏行为不会泛化出「涌现性错位」 — 1a3orn · 2026-09-09
- 对称推论:好行为同样不会泛化为全局好行为 — 1a3orn · 2026-09-09