ConsiSpace 用几何一致性记忆把视频空间推理提升 12.6 分
Ting Huang · hf · 2026-07-22
ConsiSpace 是一个面向视频空间推理的框架,目标是解决导航感知、长视频问答这类任务里“看很多帧但空间关系老是算错”的问题。
方法要点
- 引入 geometry-consistency-aware memory,把隐式证据 token 和显式几何线索结合起来。
- 用更紧凑的证据组织方式,减少冗余观察,同时保留与任务相关的空间信息。
- 在 SFT 之后加入 UC-SSRL(Unified Consistency Self-Supervised Reinforcement Learning),奖励同时覆盖答案一致性、度量一致性和拓扑一致性。
实验结果
- 在 VSI-Bench、OSI-Bench、MMSI-Video-Bench 上评测。
- 相比最强基线,平均分提升 12.6 分。
这篇的核心结论是:视频空间推理要更稳,不能只学语义,还得把几何一致性显式纳入训练。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11