MoE黑盒攻击可拖慢首token延迟

新智元 · wechat · 2026-07-18

这篇来自 ICML 2026 的工作提出了针对 MoE 推理服务的黑盒压力测试方法 RepetitionCurse。它不需要权重、梯度,也不需要知道后端专家如何部署,只靠高度重复的输入模式,就能诱导 router 把大量 token 路由到同一小批专家,进而让某些 GPU 成为 straggler,拖慢 TTFT(首 token 延迟)。

论文的主要发现包括:

文章进一步分析了“脆弱专家”“吸引子专家”的存在,并讨论了几类防御:脆弱性感知的 Expert-GPU 映射、PPL 过滤、动态 EPLB。结论是这些办法只能部分缓解,在高 EP 或小 top-k 场景里效果有限。作者最后给出的启示是:MoE 训练阶段有负载均衡约束,但推理阶段也需要同等强度的调度与隔离机制。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →