小红书多模态推理优化:视觉Token压缩与MoE重路由
小红书技术REDtech · wechat · 2026-08-05
小红书技术团队分享了其「问一问」功能在多模态大模型推理端的协同优化实践,核心解决多图输入导致的视觉 Token 膨胀和 MoE Decode 阶段的专家计算开销问题。
视觉 Token 动态压缩(VisionZip)
- 原理:利用视觉编码器深层特征中少量 dominant tokens 已聚合主要信息的特性,在进入 LLM 前基于注意力分数识别并裁剪冗余视觉 Token。
- 全局预算竞争:同一请求内所有图片的视觉 Token 进入统一候选池竞争。信息密度高的图片(如 OCR、表格)自动获得更多 Token 配额,避免固定比例裁剪误伤细节。
- 收益:在 Qwen3-VL-32B 的 30 图样本上,裁剪 40% Vision Tokens 使 TTFT 从 687ms 降至 601ms(下降 13%),业务效果基本无损。
基于相似度的专家重路由(SERE)
- 原理:针对线上 MoE 批处理中不同 token 命中专家并集膨胀导致权重搬运增加的问题,离线计算专家功能相似度。运行时将次级专家重路由到 batch 内已激活的主专家,缩小激活并集。
- 关键专家保护:为避免结构化生成等任务在 Decode 后段出现偏差累积,构建逐层 0/1 保护矩阵,保留不可替代专家的原始路由。
- 收益:在实际业务多图负载下,TPOT 从 8.5ms 降至 7.1ms(下降 16.5%)。公开模型 Qwen3-30B-A3B 上 K=2 时 TPOT 降低 26.1%,保留 97.7% 原始效果。
两项方案均不改模型权重,并已在 vLLM 中完成适配,深度融合了定制 Triton/CUDA Kernel 与 PD 分离部署架构。
「Infra」频道最新
- DeepSeek V4 Flash 本地跑分出炉:MXFP4 量化兼顾极速与高分 — WonderRico · 2026-08-05
- AI算力每9个月翻倍:2028年将达2亿块H100等效芯片 — TansuYegen · 2026-08-05
- RTX 4070 本地跑 Minimax H3 视频生成,效果惊艳 — Athem · 2026-08-05
- a16z 播客:三家初创公司重塑美国硬科技基础设施 — a16z Podcast · 2026-08-05
- Ollama为Mac自动开启Qwen3.5推测解码,MLX后线速大幅提升 — BTA_Labs · 2026-08-05
- Python 无 GIL 版本性能实测:CPython 与 NumPy 优化详解 — abhi9u · 2026-08-05