复旦 WAM-Diff2:自回归 VLA 蒸馏成扩散模型,解码提速 15.1 倍
机器之心 · wechat · 2026-08-19
复旦大学与引望智能联合提出 WAM-Diff2,一条将成熟多任务自回归 VLA 平滑迁移为离散扩散架构的通用管线,解决自动驾驶 VLA 的两大瓶颈:逐 Token 串行解码延迟高、teacher forcing 带来的曝光偏差。基于 Qwen3-VL 骨干,核心方法:
- Block-Causal 注意力:块内 Token 双向交互、块间保持因果,块大小是连接 AR 与扩散生成的连续可调变量(B=1 即标准 AR)。
- 三级层次化蒸馏:① 块大小按 1→4→8→16→32 渐进适配;② 用对称 JSD 做范式一致的块级蒸馏,让模型学会处理带噪中间状态;③ 以 8B 扩散教师指导 2B 学生,发现师生范式一致时 Top-5 Token 重合率 58.2% 显著高于 AR 教师的 51.2%。
- 系统加速:仅范式转换即 2.8 倍解码加速(44.5→124.8 Tokens/s),叠加 FlashInfer 定制内核与 CUDA Graphs 累计 15.1 倍,延迟降至 1.5ms/token,峰值吞吐 673.4 Tokens/s,性能损失不超过 0.5 个百分点。
在 NAVSIM 上 91.1 PDMS 优于 ReCogDrive(90.8)等专用规划模型;Bench2Drive 闭环成功率 49.55%;长时域路点 L2 误差较 AR 基线降低 5.8%,且误差随预测时域的累积被有效抑制。局限:离散 Token 化引入空间量化误差,学生能力受教师上界限制。
「研究」频道最新
- HarmProfile 评测:前沿模型能力越强越有害 — Zhouyuan Ma · 2026-08-19
- 观点:技能优化只是 prompt 优化的新包装 — IanArawjo · 2026-08-19
- NBER 研究:Pangram 检测器误报率接近零 — soumitrashukla9 · 2026-08-19
- AI 风险真相:失控的权限比模型能力更致命 — bigdata · 2026-08-19
- 4300 个真实编码 Agent 会话实测:缓存命中高但成本仍平方级增长 — CShorten30 · 2026-08-19
- 贝叶斯观点赢得了 AI 辩论,却鲜有人察觉 — AdaptiveAgents · 2026-08-19