Stepped MoE 论文:单个模型可缩放为 1-4B,端侧精度反超同级稠密模型
pmttyji · reddit · 2026-10-09
arXiv 论文《Stepped MoE: Segment-Level Routing with Configurable Inference Complexity》提出统一弹性架构与稀疏激活的框架,解决端侧部署难题:
- 核心机制:模型骨干同时以上下文和目标效率规格为条件,在弹性嵌套子网络内学习激活任务相关参数,推理时可细粒度控制精度-效率权衡;
- 实际效果:单个模型可按需以 1/2/3/4B 参数运行,知识密集型基准上比同规模稠密模型高 2-5%,与各自静态版本持平,延迟与稠密模型相当;
- 部署价值:多容量点共享参数,节省端侧磁盘空间,可按设备 DRAM 与算力灵活选择服务规格。
对端侧 LLM 部署和弹性推理是值得关注的新方向。
所属事件:苹果提出 Stepped MoE,单模型弹性调节 1-4B 参数(2 条相关)→
「Infra」频道最新
- 三星季营业利润预计暴涨 780%,AI 热潮下 DGX Spark 内存之谜有解 — chemist_slime · 2026-10-09
- TRL v1.15 融合 LM head,峰值显存省 82%、序列长 7 倍 — QGallouedec · 2026-10-09
- 在核显上跑 22B 视频模型 LTX-2.5:权重留 NVMe 逐层流式加载 — Business_Swordfish_5 · 2026-10-09
- 亚太数据中心缺口 2800 亿美元,柔佛成最大新建市场 — shashib · 2026-10-09
- DLoop 循环式投机解码:目标模型前向减少,实测加速提升 5-41% — pmttyji · 2026-10-09
- OpenTelemetry 提出原生可观测设计:产品天然可对接任意观测栈 — dhruv_ahuja · 2026-10-09