ConsiSpace 用几何一致性记忆把视频空间推理提升 12.6 分
Ting Huang · hf · 2026-07-22
ConsiSpace 是一个面向视频空间推理的框架,目标是解决导航感知、长视频问答这类任务里“看很多帧但空间关系老是算错”的问题。
方法要点
- 引入 geometry-consistency-aware memory,把隐式证据 token 和显式几何线索结合起来。
- 用更紧凑的证据组织方式,减少冗余观察,同时保留与任务相关的空间信息。
- 在 SFT 之后加入 UC-SSRL(Unified Consistency Self-Supervised Reinforcement Learning),奖励同时覆盖答案一致性、度量一致性和拓扑一致性。
实验结果
- 在 VSI-Bench、OSI-Bench、MMSI-Video-Bench 上评测。
- 相比最强基线,平均分提升 12.6 分。
这篇的核心结论是:视频空间推理要更稳,不能只学语义,还得把几何一致性显式纳入训练。
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27
- AMD R9700 开启动态 VRAM 后,LTX 2.3 生成速度大幅提升 — xdcfret1 · 2026-07-27