机器人基准只奖励 0.2% 提升,真实场景却从 92% 掉到 43%

kscottz · x · 2026-07-28

这条引用帖在批评机器人竞赛和评测体系:大家被奖励的是在 benchmark 上把成绩再提高 0.2%,结果容易走向 过拟合,而不是去做更难、更无聊但更重要的事——建设更好的数据集。

作者强调,机器人领域真正缺的往往不是继续微调模型,而是让数据和部署环境更一致。举的例子很典型:很多机器人一直在桌子上折 T 恤,却没有在真正的洗衣店场景里工作。

被引用的内容还给出一个现实落差:某团队内部真实环境评测成功率有 92%,到了客户现场只剩 43%。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →