LiquidAI 把投机解码扩展到视觉语言模型,文本图像统一处理

JosephJacks_ · x · 2026-09-25

LiquidAI 介绍如何将他们用于文本 LFM 的投机解码(speculative decoding)方法自然扩展到视觉语言模型。

核心观察:信息到达语言骨干的隐层时,文本 token 和图像 patch 都已表示为张量,从 drafter(草稿模型)视角看原始模态不再重要。具体做法是用轻量 drafter 基于 LFM2.5-VL-3B 不同层的隐藏状态猜测后续多个 token,目标模型单次前向验证整个块。

由于匹配采样设置下投机解码与直接从目标模型采样在分布上等价,输出是无损的。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →