机器人版 GPT-3 时刻:看一遍演示就能学会新任务
量子位 · wechat · 2026-09-06
量子位长文梳理 In-Context Learning(ICL)在具身智能领域的兴起:Skild AI 的 S1 只需看一遍任务演示视频,无需微调即可完成 10 分钟长、几十步骤的新任务;Generalist AI 的 GEN-1.5 也以 One-Shot 学习为核心,数秒内学会新任务。测试显示对未见任务,加入视频 context 后模型表现比纯语言指令提升约 7 倍。
文章回顾了从 GPT-3 提出 ICL 到 7 月李飞飞、Jim Fan 等合著 RoboTTT 首次把“上下文 scaling”搬进机器人策略的过程,并采访了专注具身 ICL 的国内创业公司可可矩阵。创始人高宇翔(JHU 博士辍学,曾在傅利叶带队全尺寸人形机器人链路)指出:堆数据没有带来通用泛化,具身 ILC 难点在视觉理解、多模态数据缺口(触觉/本体感知)和长时记忆。公司主张“强理解、轻生成”——用随任务意图动态提取的条件表征替代固定视觉 Embedding,实验中把动作头压到 60M 参数仍胜过 1.1B 对照方案。未来重点包括 KV Cache 压缩的流式记忆与人机教学交互数据的采集标准。
「具身」频道最新
- 小米人形机器人进厂实训:66 自由度,插螺纹件成功率 98% — Olivier__OG · 2026-09-06
- ETH Zurich 开源 2026 机器人学习课:12 周覆盖 VLA 与基础模型 — Syntetisaattori · 2026-09-06
- Yacine 自制眼动追踪硬件:自写驱动提速,双摄像头横竖交叉锁定光点 — yacineMTB · 2026-09-06
- StarVLA 开源 VLAct:16 张 GPU 训出 VLA 底座,20% 数据超 NVIDIA GR00T N1.6 — 机器之心 · 2026-09-06
- Show Lab 首投 CoRL 2026 三篇全中:MetaWAM 在 RoboCasa 达 68.9% 成功率、推理延迟降 39% — MikeShou1 · 2026-09-06
- NSF 投入 3000 万美元建人机协同适应研究中心,UT Austin 牵头 — PeterStone_TX · 2026-09-06