MoE 推理优化:为何不按文档而非 token 选专家?
nbvehrfr · reddit · 2026-08-25
作者质疑当前 MoE 大模型让每个 token 独立选择所有专家的做法,认为这导致了推理时显存需求过高。文章提出了一种替代方案:使用小型草稿模型读取文档前 100 个 token,预测相关的专家池,将该池加载至 VRAM 并常驻,随后仅在该池内进行 token 级别的路由。作者指出,对于长上下文任务,语义领域通常不会在短时间内频繁跳变。
「Infra」频道最新
- 双节点 GB10 Spark 集群应选何引擎运行 LTX/Wan/MiniMax — ElSrJuez · 2026-08-25
- .NET 开发者吐槽:用 ONNX 跑 Whisper 太复杂 — SecondCobra · 2026-08-25
- MTPLX 让苹果 Silicon 本地推理提速 3 倍 — julianharris · 2026-08-25
- 苏格兰拟建全球第二大数据中心,遭 1600 人反对 — nordicinst · 2026-08-25
- 研究:量子处理器扩展需权衡规模与时空成本 — jwt0625 · 2026-08-25
- 传苹果新款 Mac mini 九月前发布,本地跑 AI 或成溢价卖点 — Scobleizer · 2026-08-25