从失败动作反推目标:有界理性规划代理的在线贝叶斯目标推断
xuanalogue · x · 2026-10-11
xuanalogue 分享了自己的博士工作 arXiv:2006.07532《Online Bayesian Goal Inference for Boundedly-Rational Planning Agents》:人类能从他人失败的动作序列中推断其目标并施以援手,该研究让机器具备类似能力。方法将代理建模为边搜索边执行、会重规划的有界理性规划者,用概率程序表达,并提出 SIPS(Sequential Inverse Plan Search)这一序列蒙特卡洛算法,随新动作增量扩展推断出的计划以限制计算量。实验显示该方法优于贝叶斯逆强化学习基线,能从含失败与回溯的非最优轨迹中准确推断目标,并在组合结构与稀疏奖励的领域间泛化。
「研究」频道最新
- RLHF 核心思想真是 OpenAI 发明?X 上掀起溯源之争 — binarybits · 2026-10-11
- LLVM 编译器内部原理系列教程:从零手写一个 LLVM Pass — sh4dy_0011 · 2026-10-11
- 多 harness 强化学习兴起,Kimi、DeepSeek 等混用训练 — zainhas · 2026-10-11
- StructureGS-SLAM:结构感知高斯泼溅 SLAM 框架发布 — rsasaki0109 · 2026-10-11
- 对齐研究者荐读:Rohin Shah 价值学习序列与模型误设反强化学习 — xuanalogue · 2026-10-11
- 循环模型新方法:1.6B 模型用 1/3 KV 缓存追平全缓存基线 — rupspace · 2026-10-11