Meta 首个 Loop MoE Scaling Law:稀疏省 3 倍、循环省 2 倍算力
facebook · hf · 2026-10-01
Meta 提出 Loop Scaling Laws,首个同时建模「循环(recurrence)」与「稀疏(MoE)」两条效率路线的 scaling law:用有界、随稀疏度条件变化的循环映射刻画 looping 带来的有效参数增益及稀疏度如何放大该增益。该定律对 looped 模型 held-out loss 的预测优于既有方法,且能把标准 dense 与 MoE scaling law 作为特例恢复。实测显示:稀疏带来约 3 倍有效参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模下,等训练算力时按定律设计的 looped MoE 可匹敌约 2 倍大的非 looped MoE,并支持通过循环做测试时扩展。
「Infra」频道最新
- SemiAnalysis 注入故障实测:GPU 集群租赁商可靠性差距悬殊 — AccBalanced · 2026-10-01
- Reddit网友跑DeepSeek无人值守循环:2.37亿token仅花3.48美元 — dogfoodarchitect · 2026-10-01
- 基于 Cornell 教程为团队自制 GPU 架构入门课程 — idanbeck · 2026-10-01
- Qwen Flash Next MTP 工作重启,官方 GGUF 量化与 llama.cpp PR 上线 — jacek2023 · 2026-10-01
- Strata 采样参数冷知识:run 配置里可加 sampling 块设默认值 — KissMyShinyArse · 2026-10-01
- 87GB 大模型 Qwen3.8 Flash Next 单卡 RTX 5090 跑到 150 t/s — CurieuxExplorer · 2026-10-01