研究者反思 RLHF 监控盲区与对齐技术的滥用风险

JacksonKernion 指出,并非所有强化学习运行都受到严密监控或具备完整安全环境,存在运行失控的风险,并以 Hugging Face 事故为例引发反思。他认为目前已发布的模型在误差范围内基本是对齐的,但 RL 运行的决策取决于个人特质,并预见近未来不同实验室可能将模型对齐向对抗性目标——这种风险之所以存在,恰恰因为对齐问题本身已基本解决。

2026-08-31 ~ 2026-08-31 · 2 条相关