ICML 论文支撑对齐论证:奖励函数只能部分识别,换数据源目标随之一变

gleech · x · 2026-09-07

gleech 引用 ICML 2023 论文《Invariance in Policy Optimisation and Partial Identifiability in Reward Learning》(Skalse、Russell、Gleave 等)作为论证支柱:奖励学习常存在多个与数据同样拟合的奖励函数,即使在无限数据极限下奖励函数也只能部分识别。论文形式化了专家示范、轨迹比较等数据源的偏识别性,并分析其对策略优化的下游影响——改变底层真实生成器对目标("价值观")的伤害大于对能力的伤害。

所属事件:gleech 论对齐难于能力:能力有反馈,目标错误难暴露(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →