2000+导航任务实测:大模型离零样本实时控制还有多远

PaulYacoubian · x · 2026-09-29

研究团队给 Jev 等多个模型与 harness 配上机器人身体,在 133 个真实与仿真环境中测试 2000+ 项导航任务,并与 Dimcode、Astra、Fable、Opus、5.6 等模型横向对比。

评测维度包括速度、成本、token 消耗、碰撞次数与路径质量,回答的核心问题是:大模型离零样本完成复杂实时控制任务还有多远。完整数据集、代码与论文已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →