Dust 无反传预训练复现存疑:配 AdamW 落后约 1 nat 且多耗 2000 倍 GPU 时
ChengleiSi · x · 2026-10-07
有研究者复现了 Dust——首个接近甚至超越 backprop 预训练 transformers 的零阶方法(原称比 SOTA 进化策略 EGGROLL 高 1,000–10,000 倍算力效率)。复现结论:
- 数字本身真实,但仅在与 backprop 同用 SGD 时打平;换 AdamW 后 backprop 在 10M tokens 处好约 1 nat,Dust 用 Adam 也落后 0.5 nat,差距不可忽略
- 达到该效果耗约 2,000 倍于 backprop 的 GPU 时
- 更关键的是,Dust 去掉的是反向传播而非前向成本:每次打分扰动仍需从扰动层跑到输出的前向传播,显存与 FLOPs 上并不比带梯度检查点的 backprop 更省
- 代码与报告已公开
「研究」频道最新
- π 的无理性指数上界压到 6.0446,证明已用 Lean 4 完整形式化 — Michael_D_Moor · 2026-10-07
- 3-sum 降到 n^1.999 让人担心数学「丑陋」?换个视角又美了 — thomasahle · 2026-10-07
- NVIDIA 发布 UNREAL:一个模型统一语料检索与 128K 长上下文 — nvidia · 2026-10-07
- 实测 LLM 当 RAG 质量评审:gpt-4.1-nano 仅比瞎猜略好 — Giulio Zeloni · 2026-10-07
- SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍 — Gunho Park · 2026-10-07
- 从纯像素学出判别性表示,Drifting Models 的 FID 降低 82–95% — Doudou Zhang · 2026-10-07