探索作为第三预训练维度:大幅提升数据与算力效率
kastnerkyle · x · 2026-08-02
Alexi Glad 提出了「探索式建模」,在传统的参数和数据之外,发现了预训练的第三个维度:探索。
核心发现如下:
- 收益随规模增长:随着数据量增加,探索带来的收益从 7% 提升至 36%;随着参数量增加,收益从 13% 提升至 23%。在 3 倍算力下,收益翻倍。
- 效率大幅提升:在接近 SOTA 的基线模型上加入探索,可使数据效率提升 6.2 倍,FLOP 效率提升 4.1 倍,参数效率提升 47%。
- 优异的生成表现:在 ImageNet 上实现了近乎 SOTA 的 1.43 无引导 FID。
该方法允许用训练算力换取泛化能力,其最简单的实现形式仅仅是一个 for 循环。
所属事件:论文提出预训练第三维度“探索”,大幅提升泛化与效率(5 条相关)→
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24