TOPReward 直接读 VLM 概率,零训练就能做机器人奖励模型
DJiafei · x · 2026-07-26
这条帖在回应别人对项目的介绍,核心信息是机器人方向的奖励模型 TOPReward:它不靠额外训练,而是直接读取预训练 VLM 的 token 概率来判断模型内部“信念”。
- 零训练、无需 fine-tuning
- 可用于开源模型
- 作者称它相比已有方法优势明显,而且已经在真实场景中运行
- 另外,已有后续工作开始使用他们的 reward model 来优化策略
发帖人补充说,看到很多 follow-up works 基于他们的 reward model 做 policy refinement 也很鼓舞。
「具身」频道最新
- Orca 开源灵巧手研究栈,打通遥操作与训练 — tensorqt · 2026-07-26
- 黄仁勋称 Optimus 可能催生万亿美元级人形机器人产业 — XFreeze · 2026-07-26
- 本周 AI 论文盘点:世界模型、具身智能体与自改进 agent — _akhaliq · 2026-07-26
- 阿里和港中文用一张图预测机器人场景的 4D 未来 — jiqizhixin · 2026-07-26
- Vivix A1 可在交互中途接收语音、文本和图像 — Scobleizer · 2026-07-26
- Vivix A1 展示语音、眼神与动作同步的具身交互 — Scobleizer · 2026-07-26