RL 局部行为难泛化:好与坏都不会成全局人格

1a3orn 延续线程指出,RL 训练中「看到自己」做坏事的局部经历目前并不会涌现出全局性错位(misalignment)。他进一步给出对称推论:由于「好」与「坏」本是人造标签,同样的逻辑反过来也成立——RL 中的局部好行为同样不会泛化为全局性的好行为。

2026-09-09 ~ 2026-09-09 · 2 条相关