Kevin Murphy 新短文:融合 ACGVF 与 25 年前 HHMM 的层级强化学习

sirbayes · x · 2026-09-15

Kevin Murphy 发布 mini-paper《A note on goal-based hierarchical RL》,将 Geraud Tasse 等人的 agent 中心广义价值函数(ACGVF)与自己 25 年前关于层级隐马尔可夫模型(HHMM)的工作统一。ACGVF 让智能体自行决定追求哪个目标、何时宣告目标完成(外加动作选择),是涵盖几乎所有先前 RL/控制/规划工作及部分认知科学形式化的通用框架,但假设环境完全可观测;Murphy 此前基于内部信念状态的 agent 设计则假设目标由外部给定。新论文用 HHMM 形式化统一并扩展两者。注意:暂无实验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →