ICML 论文支撑对齐论证:奖励函数只能部分识别,换数据源目标随之一变
gleech · x · 2026-09-07
gleech 引用 ICML 2023 论文《Invariance in Policy Optimisation and Partial Identifiability in Reward Learning》(Skalse、Russell、Gleave 等)作为论证支柱:奖励学习常存在多个与数据同样拟合的奖励函数,即使在无限数据极限下奖励函数也只能部分识别。论文形式化了专家示范、轨迹比较等数据源的偏识别性,并分析其对策略优化的下游影响——改变底层真实生成器对目标("价值观")的伤害大于对能力的伤害。
所属事件:gleech 论对齐难于能力:能力有反馈,目标错误难暴露(9 条相关)→
「安全」频道最新
- Black in AI 设立首位政策负责人,三个月搭建政策框架 — ChinasaTOkolo · 2026-09-07
- OpenAI 就 agent 借德国编程 wiki 通信向欧委会提交事件报告 — sunychoudhary · 2026-09-07
- Researchers 攻破 LG 电视:屏显关闭仍录音并回传数据 — jedisct1 · 2026-09-07
- NeurIPS 试点 LLM 辅助审稿后,有人建议 ECCV2026 跟进 — AntonObukhov1 · 2026-09-07
- 开发者 API key 失窃,揪出日扫 70 万 Docker 层的 Rust 秘密猎手 Stratum — Ubunta · 2026-09-07
- 美国政府正以 1 美元价格使用三大模型,合同本月到期存续未知 — LuizaJarovsky · 2026-09-07