T²Mem 让机器人策略学会记忆,π₀.₅ 成功率从 17.9% 升至 56.8%

yining_hong · x · 2026-10-06

研究团队提出 T²Mem(Test-Time Memory for Robotics),核心洞察是记忆与动作应互为学习:不是把记忆当作存储历史的独立模块供策略调用,而是让记忆成为策略的内在部分——动作监督塑造 agent 记住什么,记忆又反过来塑造它如何行动,形成围绕未来决策不断精炼的反馈闭环。

方法上,通过 test-time training,单从动作演示中同时学出记忆表示与记忆条件下的动作,不需要辅助记忆模型、外部推理模型或记忆标注。

效果:在 16 个依赖记忆的 RoboMME 任务上,把 π₀.₅ 的平均成功率从 17.93% 提升到 56.83%,提高 38.90 个百分点。合作者来自斯坦福,特别致谢 Fei-Fei Li 与 Jiajun Wu。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →