对齐研究者荐读:Rohin Shah 价值学习序列与模型误设反强化学习
xuanalogue · x · 2026-10-11
对齐研究者 xuanalogue 在讨论中推荐了 Rohin Shah 的 value learning 序列,其中《Model Mis-specification and Inverse Reinforcement Learning》一文与「更好地建模人类错误」的研究议程最为直接相关。该文探讨了逆强化学习中的模型误设问题:当人类行为偏离理想化理性假设时,标准的 IRL 推断会把人类的失误误当作偏好的一部分,从而学错价值函数,这是早期 CHAI 路线的核心关切之一。
「研究」频道最新
- RLHF 核心思想真是 OpenAI 发明?X 上掀起溯源之争 — binarybits · 2026-10-11
- LLVM 编译器内部原理系列教程:从零手写一个 LLVM Pass — sh4dy_0011 · 2026-10-11
- 多 harness 强化学习兴起,Kimi、DeepSeek 等混用训练 — zainhas · 2026-10-11
- StructureGS-SLAM:结构感知高斯泼溅 SLAM 框架发布 — rsasaki0109 · 2026-10-11
- 从失败动作反推目标:有界理性规划代理的在线贝叶斯目标推断 — xuanalogue · 2026-10-11
- 循环模型新方法:1.6B 模型用 1/3 KV 缓存追平全缓存基线 — rupspace · 2026-10-11