RoboTTT 把测试时训练带入机器人策略

RoboTTT 是一项面向机器人策略的新研究,按帖文介绍由 Stanford SVL 与 NVIDIA Robotics 合作提出,核心是把 test-time training 直接带入部署时的推理阶段。模型在执行过程中持续对一个小型内核网络做梯度更新,把不断到来的历史经验压缩进参数里,从而让机器人在不依赖超大显式上下文窗口的情况下使用更长时程的信息。这一方向受到关注,是因为真实装配与操作任务往往持续数分钟,还包含多阶段决策,而现有机器人策略常只能利用很短的历史。

关键做法

与单纯扩大输入窗口不同,RoboTTT 的思路是在推理时持续微调一个小模块。多条帖子都将其概括为把最近经验“写进”权重,而不是只依赖短期缓存或单步观测;因此,策略是在边执行边吸收新经验。

已披露结果

多条帖子一致提到,RoboTTT 将机器人视觉—运动上下文原生扩展到 8,000 timesteps,另有帖子将其描述为约 5 分钟的记忆长度。@scottereed 还指出,这一扩展是在推理延迟保持不变的情况下实现的。几条介绍帖同时拿它与常见只能保留不到 0.1 秒短历史的机器人模型作对比,强调它对长时程、多阶段任务的意义。

背景与意义

@dairai 将这项工作概括为把“context scaling”带到具身 AI。按这一表述,RoboTTT 的价值不只是延长记忆,更在于让机器人基础模型更适配那些关键状态在数分钟内逐步展开的真实任务场景。

2026-07-15 ~ 2026-07-17 · 6 条相关

一手来源

另有 1 条近重复转述:DrJimFan