ProgressCompass:补对上下文让具身进度奖励模型误差降 63%

Jianshu Zhang · hf · 2026-10-07

论文研究长任务中的上下文依赖进度估计问题:进度奖励模型 (PRM) 要判断任务进行到哪一步,但当前帧往往不足以判断,因为进度取决于之前发生了什么。

结论:具身 PRM 不是没能力估计进度,而是缺了正确上下文就迷失方向。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →