哈佛论文提出生成模型第三扩展轴:探索式训练省 4 倍算力

rohanpaul_ai · x · 2026-08-09

哈佛大学最新论文指出,生成模型可能一直缺失第三个 scaling 维度:训练过程中的探索度。

论文提出 Explorative Modeling,将 best-of-K 机制融入训练阶段:每次更新时模型生成 K 个候选样本,仅让最接近目标的候选样本参与梯度更新。这使得不同隐变量能专注于不同模态,而非被强行拉向平均值。

在基于 RAE 的图像生成实验中,该方法以 6.2 倍更少的训练样本和 4.1 倍更少的计算量就达到了基线模型的最终性能。如果该趋势在更大规模训练中成立,未来的计算最优策略除了堆参数和数据,还需将“探索预算”纳入考量。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →