腾讯等提出 ProLaViT:让 MLLM 在潜空间进行视觉推理
jiqizhixin · x · 2026-07-30
针对 AI 模型在复杂视觉推理上容易出错的痛点,腾讯、浙江大学和北京大学联合提出了 ProLaViT。
- 核心方法:通过自蒸馏技术,教导多模态大语言模型(MLLM)在压缩的潜在空间中进行视觉推理。
- 优势:无需进行昂贵的图像生成,也无需依赖外部工具。
- 效果:在以视觉为中心的基准测试中,准确率和效率均超越了基线模型。
「多模态」频道最新
- Hyper3D 推出 Bang to Parts:一键将 3D 模型拆解为可编辑组件 — JaynitMakwana · 2026-07-30
- NVIDIA发布3D重建新方法NHT,质量全面超越ZipNeRF — ZGojcic · 2026-07-30
- ComfyUI 全自动视频换脸教程:结合 Florence 2 与 SAM2 — petewoodbridge · 2026-07-30
- Baseten 为 GLM 5.2 拼接 Kimi 视觉模块,推出多模态版 — Practical-Collar3063 · 2026-07-30
- Cohere 分享:优化 AI 视频生成的背景与前景平衡 — Cohere_Labs · 2026-07-30
- PixVerse 上线深度图控制,精准掌控视频运镜 — SucceededMind · 2026-07-30