Understanding AI 长文:从 RT-2 谷歌如何引爆机器人 VLA 浪潮

binarybits · x · 2026-09-03

Timothy B. Lee 在 Understanding AI「机器人周」发表长文,用最少的数学与术语解释视觉-语言-动作(VLA)模型。要点:- LLM 领域的真正突破公认是 2020 年的 GPT-3(1750 亿参数、3000 亿 token 训练),从 GPT-3 到 2025 年的 Claude Code 经历了长上下文、工具使用、上下文管理等多年技术积累。- 机器人领域的「GPT-3 时刻」是 2023 年 7 月谷歌发布 RT-2:训练多模态 LLM 直接输出机器人动作,参数量达数十亿,远超前作 RT-1 的 3500 万参数。- 作者认为机器人行业正沿着 LLM 走过的类似路径演进,从通用基础模型到可用的智能体还需多年打磨。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →