AVIS 论文提出双轴自适应推理缩放,获 NeurIPS 2026 接收
CSProfKGD · x · 2026-09-25
论文 AVIS: Adaptive Visual Inference Scaling for Vision-Language Models 被 NeurIPS 2026 接收,作者来自 Ahmadreza Jeddi 等 11 人团队。
核心思路:现有 VLM 的测试时缩放通常只优化单一维度——要么放大视觉上下文,要么做更多推理 rollout。AVIS 则按查询动态分配两个耦合轴的计算:
- Visual Context Scaling (VCS):通过 Key Diversity Visual (KDV) 剪枝实现——一个无需训练的 O(N) 基于键的规则,在 prefill 前移除冗余视觉 token;
- Visual Reasoning Scaling (VRS):用自适应自洽性,由学习到的难度预测器决定推理 rollout 数量。
工程上部署友好:所有 rollout 复用单次 prefill 与 KV cache(共享 prefill 推理)。在多个图像与视频推理 benchmark 上,AVIS 取得了比只缩放单一维度方法更好的准确率-计算量权衡。论文、代码与项目主页均已公开。
「模型」频道最新
- 曝 OpenAI 将在 DevDay 发布网络安全专用模型 GPT-6 Cyber — emmanuelvivier · 2026-09-25
- Anthropic 官方发布 Opus 5.5 提示词指南:校准力度而非拉满 — CodeByPoonam · 2026-09-25
- OrcaSAQ-2-27B 登上 HF 热榜:基于 Qwen3 的 3-bit 混合精度量化模型 — orcarouter · 2026-09-25
- 1978 年逻辑谜题书揭穿大模型「背答案」:换条件就崩 — JafarNajafov · 2026-09-25
- 开发者亲历:Opus 5.5解决视频剪辑,「我成了唯一瓶颈」 — LeviTurk · 2026-09-25
- 并非所有任务都需要旗舰模型:本地部署与低价模型分流付费用户 — haider1 · 2026-09-25