Understanding AI 长文:从 RT-2 谷歌如何引爆机器人 VLA 浪潮
binarybits · x · 2026-09-03
Timothy B. Lee 在 Understanding AI「机器人周」发表长文,用最少的数学与术语解释视觉-语言-动作(VLA)模型。要点:- LLM 领域的真正突破公认是 2020 年的 GPT-3(1750 亿参数、3000 亿 token 训练),从 GPT-3 到 2025 年的 Claude Code 经历了长上下文、工具使用、上下文管理等多年技术积累。- 机器人领域的「GPT-3 时刻」是 2023 年 7 月谷歌发布 RT-2:训练多模态 LLM 直接输出机器人动作,参数量达数十亿,远超前作 RT-1 的 3500 万参数。- 作者认为机器人行业正沿着 LLM 走过的类似路径演进,从通用基础模型到可用的智能体还需多年打磨。
「具身」频道最新
- 反事实调试:百万步因果归因定位 world model 智能体的 sim2real 缺口 — MichaelD1729 · 2026-09-03
- 第三方实测 MolmoAct 2:对颜色敏感但抓小物件仍吃力 — YuXiang_IRVL · 2026-09-03
- Agility 机器人 Digit 学会搬运任意纸箱,告别固定托盘任务 — jonstephens85 · 2026-09-03
- 开发者把状态灯接 Gumloop,实时显示 AI agent 工作动态 — aronkor · 2026-09-03
- ESP32 外夹电流传感器,无需液位计估算油箱余量 — JeremyCMorgan · 2026-09-03
- 人形机器人难商业化?ARK 指 Figure 用新应用破解数据瓶颈 — DMaguireARK · 2026-09-03