三星团队 RoboICL:冻结 GPT-6Astra 靠示范与记忆让机器人零训练学操作
机器之心 · wechat · 2026-10-01
三星大模型团队(通讯作者唐业辉)发布 RoboICL:不训练任务专用 VLA,冻结 GPT-6 Astra,在推理时把同任务示范和机器人自身执行历史组织为「观察→动作→执行回执→结果观察」的具身上下文,直接输出双臂动作。论文与代码已开源。
主要结果
- RoboDojo 30 项双臂任务 Overall 50.64,高于最强对比方法 Physical RSI 的 39.56;比官方零样本基线 RoboProbe 高约 20-27 分
- Open 类零样本达 54.75 分,说明在线经验的保存与组织本身就能改变同一冻结模型的能力
- 项目页公开 929 条可播放的三视角执行记录,可逐任务逐布局核查
- 真机 Franka 单臂三任务:从零样本 14.45 提升至一示范 63.33、三示范 78.89
关键设计
- Execution receipt:记录模型提议动作与真实执行差异,避免后续决策建立在错误状态上
- Bounded anchored memory:固定保留初始交互+时间轴锚点+最近交互,插入 TRAJECTORYGAP 标记省略段;对照显示锚点记忆 80.25 vs 只留最近历史 73.50
- 示范与记忆槽位预算分配实验:J=B=12 最优,示范过密(22,2)反而降至 60.75
- 长上下文推理依赖 KV 缓存:1.225 亿输入 token 中 92.4% 命中缓存
边界:仿真主结果用 seed0,progress score 不等于成功率,真机仅 3 任务各 5 次试验;毛巾折叠显示模型可能过度沿用示范的运动尺度。
「具身」频道最新
- 宇树 T 系列人形机器人演示「鲤鱼打挺」起身动作 — jonstephens85 · 2026-10-01
- Dyna-2.1 详解:首个实现 1 小时全身灵巧自主的物理 Agent — chris_j_paxton · 2026-10-01
- 轮式半人形机器人为何用 RL 做控制:作者给出三点理由 — chris_j_paxton · 2026-10-01
- InSpatio-World 1.5 发布:一张图生成可探索4D世界,登顶WorldScore — Scobleizer · 2026-10-01
- Tu Darmstadt MiTaS 论文:多分辨率触觉融合让机器人成功率升至 80% — GeorgiaChal · 2026-10-01
- IROS 辩论:通用机器人粗放抓放 19/20,精密插装仅 2/20 — GeorgiaChal · 2026-10-01