苹果提出 Stepped MoE:单模型可调 1-4B 参数,精度反超稠密版
apple · hf · 2026-10-08
Apple 在 Hugging Face 发布论文 Stepped MoE,提出统一弹性结构与稀疏门控的框架,让一个模型同时适应部署算力约束与任务需求。
- 模型骨干以上下文和目标效率规格为条件,在弹性嵌套子网络中激活任务相关参数,可在推理时细粒度控制精度-效率权衡。
- 实验显示单个模型可灵活运行在 1/2/3/4B 参数档位,在知识密集型基准上比同规模稠密模型高 2-5%,与各自的静态版本持平,延迟接近稠密模型。
- 靠参数共享节省端侧磁盘占用,可按设备 DRAM 和算力灵活选择服务规格,面向边缘部署场景。
「Infra」频道最新
- 开源 AI-SQL 引擎 Quail 上线 prefix sharing:token 省 3 倍、提速 2.6 倍 — sh_reya · 2026-10-08
- 从 SSD 流式加载专家:DeepSeek V4.1 在 Mac 上跑到近 40 tps — HankYeomans · 2026-10-08
- Cloudflare 的机器支付豪赌:7500 万笔小额交易瞄准 $2000B 市场 — LexSokolin · 2026-10-08
- GPU 租赁全代际涨价:Nebius H100 提价 17%、B300 提价 21% — Beth_Kindig · 2026-10-08
- TypeSafeAI 上线四天在 Modal 上服务万亿 token,推理需求持续暴涨 — josh_wills · 2026-10-08
- OpenAI 算力「速通」:前后对比图看训练规模暴涨 — ns123abc · 2026-10-08