扩散模型缩放定律:算力最优配比与 LLM 截然不同
burny_tech · x · 2026-08-25
论文《ABRA: Scaling Diffusion Image Training》发现,扩散图像模型的缩放规律虽与 LLM 类似,但算力最优配比截然不同。研究指出,扩散模型每参数约需 200 个图像 token(约为 Chinchilla 推荐值的 10 倍),且相比训练不足,它们更能容忍过度训练。因此在固定算力下,训练更小但数据量更大的模型是更稳妥的选择。
「模型」频道最新
- Kimi成硅谷新宠:Harvey、Cursor等美企竞相采用中国基座 — APPSO · 2026-08-25
- 阿里预告 Qwen3.8-Flash-Next 架构升级,下代模型将开源 — bclavie · 2026-08-25
- 实测发现 ChatGPT 仍在按名搜索特定 Subreddit — gaganghotra_ · 2026-08-25
- LLM 用久了会发现:记忆功能常帮倒忙,遗忘或是最优解 — sebpaquet · 2026-08-25
- 疑似智谱 GLM 5.3 Flash 版本界面曝光 — LegacyRemaster · 2026-08-25
- 研究显示 LLM 技能与语言相关,英语推理可恢复性能 — LChoshen · 2026-08-25