GPD 几何特权蒸馏:训练时注入 3D 证据,部署仍为纯 RGB,VSI-Bench 达 57.1
zju · hf · 2026-10-09
浙大团队提出 GPD(Geometry-Privileged Distillation),针对 VLM 空间推理弱、而现有方案要么推理时注入 3D 付出架构与延迟代价、要么只监督最终答案的问题:把几何证据当作在线策略自蒸馏(OPSD)中的特权信息。
对每个问题,深度、语义与鸟瞰图(BEV)线索被渲染为紧凑文本,与参考答案一起路由给教师;特权 KL 仅施加于错误轨迹以增强 GRPO,部署模型保持纯 RGB 输入。4B 骨干在 VSI-Bench 达 57.1,MindCube/SPARBench/MMSI-Bench/ViewSpatial 平均 37.6,均超 GRPO 与答案特权 OPSD。消融验证了 3D 与答案特权的互补性及问题条件路由的优势。
「模型」频道最新
- AI 没破解 RSA-2048?网友质疑 OpenAI 只是没公开内部结果 — ChrisGPT · 2026-10-09
- OpenAI 释出 719 篇数学证明,西方开源模型齐发对抗中国 — Last Week in AI · 2026-10-09
- 开源 NSFW 图像分类器 Blue-Eye 跑分 88.9%,胜过 AWS 与 Google Vision — Mundane_Toe_8074 · 2026-10-09
- 「套壳」批评正在失效:Genspark 定制 MiniMax 模型做演示文稿 — polopat96 · 2026-10-09
- 评测显示所有模型都差?作者发现答案密钥取错了时间点 — jgarg27 · 2026-10-09
- Ai2 高管回应质疑:下一代 Olmo 模型已在训练,全面开源路线不变 — sewon__min · 2026-10-09