从失败动作反推目标:有界理性规划代理的在线贝叶斯目标推断

xuanalogue · x · 2026-10-11

xuanalogue 分享了自己的博士工作 arXiv:2006.07532《Online Bayesian Goal Inference for Boundedly-Rational Planning Agents》:人类能从他人失败的动作序列中推断其目标并施以援手,该研究让机器具备类似能力。方法将代理建模为边搜索边执行、会重规划的有界理性规划者,用概率程序表达,并提出 SIPS(Sequential Inverse Plan Search)这一序列蒙特卡洛算法,随新动作增量扩展推断出的计划以限制计算量。实验显示该方法优于贝叶斯逆强化学习基线,能从含失败与回溯的非最优轨迹中准确推断目标,并在组合结构与稀疏奖励的领域间泛化。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →