AFM3 20B 论文提出提示级剪枝,只激活约 20% MLP 层
Aaaaaaaaaeeeee · reddit · 2026-08-04
- 这条帖指向一篇 OpenReview 论文,核心是 AFM3 20B 的 instruction-following pruning 方案。
- 该模型目标是只激活大约 20% 的 MLP 层,并且本身还带有 MoE 稀疏性。
- 其关键做法是:从头训练,让模型对同一个 prompt 使用 固定的专家组合,而不是按 token 或按层切换。
- 原帖作者认为,这会让 30B active 的 MoE 在读带宽表现上更接近 14B active 的模型,并指出它和最近的 Session-Adaptive Orthogonal Distillation 思路有相似之处。
「研究」频道最新
- 同一线程转向:生成模型里用 search 的算力成本 — YouJiacheng · 2026-08-04
- 新线程认为,搜索可将 IMLE 推广为通用生成框架 — YouJiacheng · 2026-08-04
- IMLE 可视作级联生成或自编码器,推导从 hard-min 到 KL — YouJiacheng · 2026-08-04
- IMLE 的原始视角:从 hard-min 到 KL/MLE — YouJiacheng · 2026-08-04
- Snorkel AI:agent 基准评测的可信门槛正在抬高 — ajratner · 2026-08-04
- LoopX 让长程 Agent 连跑 200 多小时也不漂移 — aigclink · 2026-08-04