哈佛论文提出生成模型第三扩展轴:探索式训练省 4 倍算力
rohanpaul_ai · x · 2026-08-09
哈佛大学最新论文指出,生成模型可能一直缺失第三个 scaling 维度:训练过程中的探索度。
论文提出 Explorative Modeling,将 best-of-K 机制融入训练阶段:每次更新时模型生成 K 个候选样本,仅让最接近目标的候选样本参与梯度更新。这使得不同隐变量能专注于不同模态,而非被强行拉向平均值。
在基于 RAE 的图像生成实验中,该方法以 6.2 倍更少的训练样本和 4.1 倍更少的计算量就达到了基线模型的最终性能。如果该趋势在更大规模训练中成立,未来的计算最优策略除了堆参数和数据,还需将“探索预算”纳入考量。
「研究」频道最新
- DeepMind 新模型登 Nature:热带气旋预警提前 24 小时 — Scobleizer · 2026-08-09
- 机器人新研究:优化接触时机,让人形机器人流畅完成跑跳体操 — Scobleizer · 2026-08-09
- 单图0.1秒重构3D场景风格:AnyStyle论文入选ACM MM — Scobleizer · 2026-08-09
- 中国构建十亿级 AI 智能体社会模拟器,预测能力惊人 — pbaylies · 2026-08-09
- Leg-KILO:面向动态足式机器人的鲁棒SLAM系统开源 — rsasaki0109 · 2026-08-09
- 物理学家主张:AI训练应激励“最难改变”的解释 — shyamalanadkat · 2026-08-09