LeRobot新增零样本奖励模型
RemiCadene · x · 2026-07-14
LeRobot v0.6 新增了一个统一的 reward models API,并加入两个零样本奖励函数:
- Robometer:一个通用奖励模型,基于 100 万+ 轨迹、21 种机器人形态训练,可直接看视频和语言指令,判断任务进度与成功情况,不需要针对具体任务再训练。
- TOPReward:更轻量,直接用现成 VLM 的输出概率来判断 “True”,不需要专门的 reward 权重。
这两个组件都带有标注脚本,可以把逐帧进度曲线写回数据集,方便后续做 reward-aware 的行为训练。
所属事件:LeRobot v0.6上线零样本奖励模型API(2 条相关)→
「编程与Agent」频道最新
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- Ron Jeffries 发文抵制 AI 编程,敏捷宣言作者为何说不 — mborch · 2026-09-11