HLA-WM:免训练混合注意力,长视频世界模型记忆省12倍
Monash · hf · 2026-10-06
研究者提出 HLA-WM,一个免训练(training-free)的混合线性注意力框架,解决长时程视频世界模型的远程遗忘问题:
- 背景长时程世界模型需要持久记忆保持场景一致性:softmax 注意力靠不断增长的 KV cache 保留全史,循环线性注意力虽省内存但发现 Gated DeltaNet(GDN)存在严重的远程遗忘。
- 方法:利用 GDN 的仿射结构缓存分块转移摘要,用相机几何检索场景相关历史分块,并重组为查询特定的循环状态,结合粗粒度几何引导检索与细粒度线性状态计算。
- 在 60 秒 SANA-WM-Bench 上,所有 6 项指标均提升,含 +0.74 dB PSNR、旋转误差降 28.5%,且无需额外训练、可迁移到 MBench-A。
- 60 秒上下文下历史状态内存较全 KV cache 减少 12 倍,推理吞吐仅降最多 1.6%。
「具身」频道最新
- LeCun 团队 H-JEPA:分层世界模型将 Visual AntMaze 成功率从 18% 提至 73% — arankomatsuzaki · 2026-10-06
- 数据对齐后 Tesla Robotaxi 似在追赶 Waymo,规模仍存疑 — binarybits · 2026-10-06
- Wayve CEO:特斯拉证明自动驾驶有需求,但消费者想要更多选择 — alexgkendall · 2026-10-06
- 骨骼肌肉形态空间漫游:会变形的骨架研究演示 — zzznah · 2026-10-06
- 刚性控制器可掩盖仿真引擎差距:软增益下偏差 16-28mm vs 不足 1mm — chris_j_paxton · 2026-10-06
- Inner Logic 创始人:手术机器人是模仿学习的天然训练场 — audrow · 2026-10-06