研究:反推黑盒奖励让 LLM 究竟学到了什么
sanmikoyejo · x · 2026-07-05
@edchene 发布论文,聚焦“黑盒奖励函数究竟把 LLM 对齐到了哪些行为”。作者指出,用不可解释的黑盒奖励做对齐会掩盖模型实际学到的目标,可能引入隐藏的偏离行为。他们提出一套检测方法,能在受控与真实设置下恢复奖励所对应的领域特定目标及其权重,定量上可解释超过 90% 的奖励行为;在“检测对齐偏离”案例中显著优于基线。项目由 @sanmikoyejo、Carlos Guestrin 等指导。
「安全」频道最新
- Meta 被指放任 AI 假医生借流量传播健康建议 — GaryMarcus · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- 共享 AI artifacts 被索引,敏感公司数据外泄 — niloofar_mire · 2026-07-27
- Hugging Face 事件后,实验室或不再严做危险能力评估 — Miles_Brundage · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- 印度 AI 政策被批偏向算力和基础模型,忽视基层医疗 — Paimaamu · 2026-07-27