ConsiSpace 用几何一致性记忆把视频空间推理提升 12.6 分
Ting Huang · hf · 2026-07-22
ConsiSpace 是一个面向视频空间推理的框架,目标是解决导航感知、长视频问答这类任务里“看很多帧但空间关系老是算错”的问题。
方法要点
- 引入 geometry-consistency-aware memory,把隐式证据 token 和显式几何线索结合起来。
- 用更紧凑的证据组织方式,减少冗余观察,同时保留与任务相关的空间信息。
- 在 SFT 之后加入 UC-SSRL(Unified Consistency Self-Supervised Reinforcement Learning),奖励同时覆盖答案一致性、度量一致性和拓扑一致性。
实验结果
- 在 VSI-Bench、OSI-Bench、MMSI-Video-Bench 上评测。
- 相比最强基线,平均分提升 12.6 分。
这篇的核心结论是:视频空间推理要更稳,不能只学语义,还得把几何一致性显式纳入训练。
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11