阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构
Alibaba-DAMO-Academy · hf · 2026-09-30
阿里达摩院发布 WorldAttention,一套面向文本条件交互式视频世界模型的高效注意力架构,解决长时程生成中的历史上下文与显存瓶颈问题。核心设计:
- Hybrid Sparse Attention (HSA):线性全局注意力 + 头自适应稀疏注意力,替代传统滑窗机制造成的上下文丢失。
- Hierarchical KV Cache (HKV):将历史 KV 对按语义索引组织到多级存储页中,细粒度检索并控制 GPU 驻留,避免 KV cache 线性增长导致显存饱和。
- 配套定制 kernel 将理论效率转化为实际性能。
在 VBench-Long 和 InterVBench 上全面超越此前 SOTA,主体一致性分别达 0.9472 和 0.9668。该架构瞄准具身智能与基于仿真的规划所需的低延迟、长时长生成场景。
「多模态」频道最新
- AutoRef 开源:面向智能体多参考图生成的 Harness 优化 — NunyaBuzor · 2026-09-30
- Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人 — justin_hart · 2026-09-30
- Reddit 用户用 AI 制作出科幻短片《Erebus-9: The Hiveborn Archives》 — himeonisama · 2026-09-30
- 让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流 — RileyRalmuto · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- KAIST 推出 Thinking Reward Model:先定评分细则再审图,开源奖励模型登顶 — Xuehai Bai · 2026-09-30