Dust 无反传预训练复现存疑:配 AdamW 落后约 1 nat 且多耗 2000 倍 GPU 时

ChengleiSi · x · 2026-10-07

有研究者复现了 Dust——首个接近甚至超越 backprop 预训练 transformers 的零阶方法(原称比 SOTA 进化策略 EGGROLL 高 1,000–10,000 倍算力效率)。复现结论:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →