小红书多模态推理优化:视觉Token压缩与MoE重路由

小红书技术REDtech · wechat · 2026-08-05

小红书技术团队分享了其「问一问」功能在多模态大模型推理端的协同优化实践,核心解决多图输入导致的视觉 Token 膨胀和 MoE Decode 阶段的专家计算开销问题。

视觉 Token 动态压缩(VisionZip)

基于相似度的专家重路由(SERE)

两项方案均不改模型权重,并已在 vLLM 中完成适配,深度融合了定制 Triton/CUDA Kernel 与 PD 分离部署架构。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →