ConsiSpace 用几何一致性记忆把视频空间推理提升 12.6 分
Ting Huang · hf · 2026-07-22
ConsiSpace 是一个面向视频空间推理的框架,目标是解决导航感知、长视频问答这类任务里“看很多帧但空间关系老是算错”的问题。
方法要点
- 引入 geometry-consistency-aware memory,把隐式证据 token 和显式几何线索结合起来。
- 用更紧凑的证据组织方式,减少冗余观察,同时保留与任务相关的空间信息。
- 在 SFT 之后加入 UC-SSRL(Unified Consistency Self-Supervised Reinforcement Learning),奖励同时覆盖答案一致性、度量一致性和拓扑一致性。
实验结果
- 在 VSI-Bench、OSI-Bench、MMSI-Video-Bench 上评测。
- 相比最强基线,平均分提升 12.6 分。
这篇的核心结论是:视频空间推理要更稳,不能只学语义,还得把几何一致性显式纳入训练。
「多模态」频道最新
- AI 视频的瓶颈不在生成质量,而在工作流 — aftahi_ai · 2026-07-22
- VideoChat3 发布 4B 开源视频模型,兼顾长视频与流式理解 — 机器之心 · 2026-07-22
- GPT Image 2 提示词示范如何做编辑风海报 — SimplyAnnisa · 2026-07-22
- AlayaWorld 开源 720p、24 FPS 视频世界模型并支持镜头控制 — fruesome · 2026-07-22
- APOB 生成的 AI 网红舞蹈已经相当顺滑 — aftahi_ai · 2026-07-22
- Skywork Video 主打分镜驱动的一站式视频工作区 — alifcoder · 2026-07-22