GPT-6 Astra 横扫 HumanCLAW 具身基准,交互成功率近乎翻三倍
LINJIEFUN · x · 2026-09-10
Kuvvius 团队用同一开源测试框架和动作生成器,将 GPT-6 Astra 跑在 HumanCLAW-Bench(Meta 等机构提出的「动作智能」基准,测试 VLM 能否指挥身体完成闭环物理动作)上,全面刷新纪录:
- FindSR 64.9%→75.5%(+10.6)、NavSR 42.4%→57.1%(+14.7)、InteractSR 16.8%→46.6%(+29.8)
- 增益会复合:找到→导航转化率 65%→76%,导航→坐下 39%→72%
- 解决了此前九个模型全部失败的 147/507(29%)个 episode
- 空间感知更克制:扰动距离 dDtb 仅 0.65 m(榜单最低),碰到物体但不持续推挤
- 空间记忆更强:坐下这类需要目标离开自我视角的任务表现明显更好
结论:通用模型在「通过身体行动」这件事上正快速逼近专用系统。
所属事件:GPT-6 Astra 横扫具身基准,成功率近乎翻三倍(2 条相关)→
「具身」频道最新
- Spiced Self-play 入选 CoRL:30 分钟人类数据足以校准自博弈 — EugeneVinitsky · 2026-09-10
- 特斯拉 FSD 斯洛文尼亚暴雨实测:监督驾驶表现惊艳 — yunta_tsai · 2026-09-10
- 赛博格蟑螂上岗:灾难现场用针头送救命药 — ChuckDBrooks · 2026-09-10
- Maven Robotics 出鞘:1 亿美元 A 轮现身抢单 — TechCrunch AI · 2026-09-10
- 头戴摄像头变机器人训练数据:MicroSLAM 单目 SLAM 登顶 LaMaria 榜 — lukas_m_ziegler · 2026-09-10
- 马斯克点赞车主「买了特斯拉基本退役不开车」言论 — elonmusk · 2026-09-10