VideoLoop 用循环工作记忆治「语义抖动」,VideoMME 长视频达88.3%
Jinfa Huang · hf · 2026-09-30
长视频理解智能体在多步推理中普遍出现「语义抖动」(semantic thrashing):只追加的工作记忆不断膨胀,对关键证据的注意力衰减,智能体丢失已找到的信息。
- 论文先给出结构性论证:append-only 记忆可纳入新证据,但没有重写算子就无法清除累积噪声、也无法阻止上下文无序增长
- 提出 VideoLoop:外循环对视频推理,内循环每步从无界文件系统取回过往观察与分析产物,重写有界工作记忆
- 以即插即用方式提升四个主流 LVLM 骨干,VideoMME (long) 平均提升 4.2 个百分点
- 在最难的四分之一 VideoMME (long) 题目上,只读上下文的盲评准确率 81.1%,而 append-only 智能体仅 60.9%
- 配 Gemini 3.1 Pro 时,VideoMME (long) 88.3%、VideoMMMU 88.8%、LongVideoBench (long) 80.9%
「多模态」频道最新
- SKF 广告用 AI 复活 Greta Garbo,卫报影评人狠批乏味数字还魂 — nordicinst · 2026-09-30
- 开发者预言:通用视频描述 DSL 将催生可控世界模拟模型 — zeeshanp_ · 2026-09-30
- RTX Pro 6000 跑满配 MiniMax H3:一段 15 秒视频生成 26 分钟、峰值 62GB 显存 — Realistic-Fennel-190 · 2026-09-30
- 用 Codex 剪 15 秒动画:模型出片,人还得给剪辑意见 — naridubs · 2026-09-30
- 一个事件四角度同屏:Flux 3 被赞最适合四分屏图生成 — umesh_ai · 2026-09-30
- MageTrail 2.8B 微调累计花 593 美元,验证小模型 booru 训练路线 — Turbulent-Bass-649 · 2026-09-30