GPD 几何特权蒸馏:训练时注入 3D 证据,部署仍为纯 RGB,VSI-Bench 达 57.1

zju · hf · 2026-10-09

浙大团队提出 GPD(Geometry-Privileged Distillation),针对 VLM 空间推理弱、而现有方案要么推理时注入 3D 付出架构与延迟代价、要么只监督最终答案的问题:把几何证据当作在线策略自蒸馏(OPSD)中的特权信息。

对每个问题,深度、语义与鸟瞰图(BEV)线索被渲染为紧凑文本,与参考答案一起路由给教师;特权 KL 仅施加于错误轨迹以增强 GRPO,部署模型保持纯 RGB 输入。4B 骨干在 VSI-Bench 达 57.1,MindCube/SPARBench/MMSI-Bench/ViewSpatial 平均 37.6,均超 GRPO 与答案特权 OPSD。消融验证了 3D 与答案特权的互补性及问题条件路由的优势。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →