MemBodied 为 VLA 模型加固定大小情景记忆,任务成功率提升 7.8 倍
Tej Deep Pala · hf · 2026-09-24
多数视觉-语言-动作(VLA)模型不保留当前观测之外的情节信息,依赖历史观测的操作任务因此受限。把过去观测塞进上下文虽可补救,但代价是上下文膨胀与推理延迟。MemBodied 提出固定大小的情景记忆:一个记录跨策略调用交互的关联状态,加一个保存初始场景紧凑表示的情景锚点,模型基于当前输入与记忆组件生成动作。
- 五个需要记忆的 RMBench 任务上,平均成功率为无状态策略的 7.81 倍、普通循环记忆的 2.98 倍,比最强记忆基线高 1.3 倍且新增参数少 10 倍
- LIBERO-Long 全观测套件达 90.6%,比无状态 π0 高 5.4%
- 为历史依赖操作任务提供替代「扩上下文」的实用方案
「具身」频道最新
- 传 Meta Connect 发布 Muse 语音钥匙扣与 VR 眼镜等新品(未证实) — davidpattersonx · 2026-09-24
- Danfei Xu:机器人其实就是计算机,结果平平无奇 — fdellaert · 2026-09-24
- 用户实测 Austin 特斯拉 Robotaxi:平顺度胜过 Uber 和 Lyft — EricETesla · 2026-09-24
- GPT-6 接机械臂做危险任务测试:拿刀刺假人、扔高压气罐,多数时候真干了 — FuSheng_0306 · 2026-09-24
- 华为 Watch D3 内置气囊袖带,£399 实现医用级血压监测 — CurieuxExplorer · 2026-09-24
- 上海 AI 实验室发布 InternW0 物理世界模型,融合视觉预测与机器人控制 — Jisong Cai · 2026-09-24