ProgressCompass:补对上下文让具身进度奖励模型误差降 63%
Jianshu Zhang · hf · 2026-10-07
论文研究长任务中的上下文依赖进度估计问题:进度奖励模型 (PRM) 要判断任务进行到哪一步,但当前帧往往不足以判断,因为进度取决于之前发生了什么。
- 发布 ContextProgress-Bench:24 个操作任务、120 条轨迹,覆盖三种设定——状态回溯、顺序追踪、相似帧进度歧义
- 配对诊断发现:即使是读取完整历史的 PRM 也会迷失,但注入正确上下文后,同样的五个模型进度误差降低 77-82%
- 提出 ProgressCompass:一个 agentic 循环,让通用 VLM 为冻结的 PRM 供应所需上下文,使同一模型误差再降 63%、排序一致性提升 76%
结论:具身 PRM 不是没能力估计进度,而是缺了正确上下文就迷失方向。
「具身」频道最新
- 父子搭档发布老年陪伴机器人 Rhem,能打电话挂号还能向子女同步健康 — ycombinator · 2026-10-07
- Sentdex 实测:决策语言模型在机器人任务中尚难替代专用方案 — Sentdex · 2026-10-07
- NeurIPS 论文:为 VLM 与机器人时空记忆加入带概率保证的不确定性量化 — lucacarlone1 · 2026-10-07
- Pantheon 八周建百万级机器人数据集:日均新增 4.5 万任务 — hamostaf04 · 2026-10-07
- Oki Home 推出「记忆电脑」:本机跑 27B 模型,1799 美元起 — Scobleizer · 2026-10-07
- Minerva 机器人公司今日出 stealth,主打干「疯狂脏活」 — kyliebytes · 2026-10-07