新论文:用训练期内部信号改善对齐且不损白盒监控

jonasgeiping · x · 2026-10-02

Frontier 模型可能在训练期表现出对齐,但部署后出现不良行为。研究者 Lena Libon 团队发布新论文,探讨能否在训练阶段利用模型内部信号来提升对齐效果。

论文给出的答案是肯定的:可以在不增加白盒监控难度的情况下,用内部信号改进对齐训练。研究者发布了一个线程介绍方法细节。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →