机器人排行榜遭质疑:每任务仅 5 次试验,作者承诺扩到 15 次
YuXiang_IRVL · x · 2026-09-21
机器人真机评测排行榜引发方法学争论。评论者 Will (woodtechwill) 指出每任务仅 5 次试验的榜单是「高光集锦」,缺乏置信区间、循环时间、卡料恢复、人工接管与干预数据等指标。UCSD 研究者 YuXiang 回应澄清评测设置为 10 个任务各 5 次试验,并承诺扩到每任务 15 次;目前已评测 7 个策略,每个策略需约 6-8 小时——坦言这是真机评测的现实成本,但会坚持改进。讨论触及真机 benchmark 的核心难题:统计严谨性与评测成本难以兼得。
「具身」频道最新
- 苹果发布 MintAct:统一视觉智能体模型,OSWorld 拿 48.9 分 — apple · 2026-09-21
- 无需显式轨迹的运动趋势引导,让 3D 扩散策略获预测能力 — dalian-university-of-technology · 2026-09-21
- OpenAI 机器人团队招聘激增,关闭五年后重返具身智能赛道 — ocean_protocol · 2026-09-21
- OpenAI 机器人岗位从 11 个增至 27 个,底薪最高 50 万美元 — Dr_Singularity · 2026-09-21
- 腱驱动式机械手演示:高自由度高速灵巧操作 — LexiLove · 2026-09-21
- 1X CEO:目标 2027 年出货 5 万台人形机器人,年产能扩至 11 万 — Scobleizer · 2026-09-21