MemBodied 为 VLA 模型加固定大小情景记忆,任务成功率提升 7.8 倍

Tej Deep Pala · hf · 2026-09-24

多数视觉-语言-动作(VLA)模型不保留当前观测之外的情节信息,依赖历史观测的操作任务因此受限。把过去观测塞进上下文虽可补救,但代价是上下文膨胀与推理延迟。MemBodied 提出固定大小的情景记忆:一个记录跨策略调用交互的关联状态,加一个保存初始场景紧凑表示的情景锚点,模型基于当前输入与记忆组件生成动作。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →