Foresight 免训练让流式 VLM 预知未来:OmniPro Online 超强基线 9.5%
Ashok Prasad Neupane · hf · 2026-10-07
Foresight 提出一种无需重训练的方法,让流式视觉语言模型(VLM)动态规划未来的计算分配。
- 核心发现:流式 VLM 天然具备预测近期未来的能力,可据此以 training-free 方式动态配置计算。
- 架构为双流孪生 LLM(共享权重、编码器与 KV cache):一个持续处理输入流,另一个跑在流前面预测未来上下文、规划何时推理、检查什么、采样多密。
- 通过 schema 引导解码与轻量 diff 更新实现在线重配置,开销极低。
- 冻结 Qwen3-VL-8B 骨干下,OmniPro Online 达 23.0 平均联合 F1,超最强已训练基线 9.5%;StreamingBench +6.7、OVO-Bench +15.4,证据越晚到收益越大(最高 +18.7)。代码将开源。
「多模态」频道最新
- ID-Forcing 方法让自回归视频模型无需微调生成分钟级长视频 — _akhaliq · 2026-10-07
- Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价 — tomaarsen · 2026-10-07
- Google 多模态嵌入模型:视觉 token 预算 70 至 1120 可调 — tomaarsen · 2026-10-07
- 嵌入模型任务前缀指南:SearchQuery 配 Document 做检索 — tomaarsen · 2026-10-07
- Matryoshka 训练加持:嵌入维度可裁至 256d 存储省三分之二 — tomaarsen · 2026-10-07
- 斯坦福提出 Level-of-Token DiT:让预训练扩散模型支持任意尺寸 token 网格 — GordonWetzstein · 2026-10-07