Kevin Murphy 新短文:融合 ACGVF 与 25 年前 HHMM 的层级强化学习
sirbayes · x · 2026-09-15
Kevin Murphy 发布 mini-paper《A note on goal-based hierarchical RL》,将 Geraud Tasse 等人的 agent 中心广义价值函数(ACGVF)与自己 25 年前关于层级隐马尔可夫模型(HHMM)的工作统一。ACGVF 让智能体自行决定追求哪个目标、何时宣告目标完成(外加动作选择),是涵盖几乎所有先前 RL/控制/规划工作及部分认知科学形式化的通用框架,但假设环境完全可观测;Murphy 此前基于内部信念状态的 agent 设计则假设目标由外部给定。新论文用 HHMM 形式化统一并扩展两者。注意:暂无实验。
「研究」频道最新
- bio 研究者质疑蛋白质折叠建模价值:称 Baker 实验室成果未在体内转化 — iskander · 2026-09-15
- Foresight 开放 AI 科学与安全 RFP,单项资助最高 10 万美元 — allisondman · 2026-09-15
- 地震预报给 p(doom) 上的一课:灾难概率到底要多精确 — beenwrekt · 2026-09-15
- Ben Recht 用地震预报类比 p(doom):灾难概率到底算得准吗 — ChuckDBrooks · 2026-09-15
- Meta FAIR 巴黎团队招聘 AI4Maths 博士后与研究员 — TacoCohen · 2026-09-15
- DeepMind 实习成果:把价值图放进 VLM 思维链,多模态潜在推理提效 20% — burny_tech · 2026-09-15