机器人排行榜遭质疑:每任务仅 5 次试验,作者承诺扩到 15 次

YuXiang_IRVL · x · 2026-09-21

机器人真机评测排行榜引发方法学争论。评论者 Will (woodtechwill) 指出每任务仅 5 次试验的榜单是「高光集锦」,缺乏置信区间、循环时间、卡料恢复、人工接管与干预数据等指标。UCSD 研究者 YuXiang 回应澄清评测设置为 10 个任务各 5 次试验,并承诺扩到每任务 15 次;目前已评测 7 个策略,每个策略需约 6-8 小时——坦言这是真机评测的现实成本,但会坚持改进。讨论触及真机 benchmark 的核心难题:统计严谨性与评测成本难以兼得。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →