探索性建模:发现参数与数据之外的第三预训练轴
burny_tech · x · 2026-08-03
Alexi Glad 提出了在参数和数据之外的第三个预训练维度:探索(Exploration)。
- 核心发现:增加探索可以单调地改善现有模型在图像、视频和语言任务上的表现,并解锁端到端生成能力。在最简单的情况下,这仅相当于一个 for 循环。
- 收益随规模增长:随着数据规模扩大,收益从 7% 增长至 36%;随着参数扩大,从 13% 增至 23%。在 3 倍算力下,收益甚至翻倍。
- 效率提升:在接近 SOTA 的基线上加入探索,可使数据效率提升 6.2 倍,FLOP 效率提升 4.1 倍,参数效率提升 47%,并在 ImageNet 上达到接近 SOTA 的 1.43 无引导 FID。
开发者 @cgarciae88 测试后表示该方法确实有效,但也观察到在某些二维示例中,生成分布的形状虽然匹配,但平滑度有所下降,多样性可能受到一定影响。
所属事件:论文提出预训练第三维度“探索”,大幅提升泛化与效率(5 条相关)→
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24