研究:反推黑盒奖励让 LLM 究竟学到了什么

sanmikoyejo · x · 2026-07-05

@edchene 发布论文,聚焦“黑盒奖励函数究竟把 LLM 对齐到了哪些行为”。作者指出,用不可解释的黑盒奖励做对齐会掩盖模型实际学到的目标,可能引入隐藏的偏离行为。他们提出一套检测方法,能在受控与真实设置下恢复奖励所对应的领域特定目标及其权重,定量上可解释超过 90% 的奖励行为;在“检测对齐偏离”案例中显著优于基线。项目由 @sanmikoyejo、Carlos Guestrin 等指导。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →