TOPReward 直接读 VLM 概率,零训练就能做机器人奖励模型

DJiafei · x · 2026-07-26

这条帖在回应别人对项目的介绍,核心信息是机器人方向的奖励模型 TOPReward:它不靠额外训练,而是直接读取预训练 VLM 的 token 概率来判断模型内部“信念”。

发帖人补充说,看到很多 follow-up works 基于他们的 reward model 做 policy refinement 也很鼓舞。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →