探索式建模开辟预训练第三轴,被指重造avataRL
近期,一项名为“探索式建模”的研究引发关注。该研究提出在传统的参数和数据之外,为生成模型预训练开辟“第三轴”。该方法通过在每一步训练中生成 K 个候选样本,仅对最接近真实数据的候选者进行训练,以提升效率。然而,该范式随后遭到质疑,被指本质上是重新发明了已有的 avataRL 框架。
已确认
- 要点 探索式建模机制:在每次训练中探索模型生成与真实数据之间的 K 个候选匹配,选取最佳匹配进行训练,支持端到端生成。
- 要点 性能提升:增加探索度能在图像、视频和语言任务上单调提升模型性能,且收益随规模扩大而增加(数据规模提升 7%→36%,参数规模提升 13%起),最高可提升 6 倍采样效率。
尚未确认
- 要点 创新独立性争议:开发者 @dejavucoder 指出,探索式建模本质上只是在重新发明 avataRL。avataRL 是一种主张在预训练阶段引入强化学习(RL)框架的新范式,模型不再受限于交叉熵下的唯一正确答案,而是基于更灵活的机制进行训练。探索式建模是否具备实质性的独立创新价值,仍需业界进一步探讨。
为什么重要
- 要点 探索式建模与 avataRL 均试图打破传统交叉熵预训练的局限,如果这些新范式能够规模化落地,将有望大幅提升大模型的数据与算力效率,改变现有的预训练基础范式。
2026-07-31 ~ 2026-08-01 · 7 条相关
一手来源
- 探索式建模:开辟第三预训练轴,最高提升 6 倍采样效率 — _akhaliq ·
- 新提的 Explorative Modeling?不过是重造了 avataRL 的轮子 — dejavucoder ·
- 探索式建模:为生成模型解锁第三预训练轴 — illinois ·
- 【源头】探索式建模:为生成模型解锁第三预训练轴 — illinois · 2026-07-31
- 预训练新维度:探索式建模大幅提升数据与算力效率 — tokenbender · 2026-08-01
- 放弃交叉熵?用强化学习从零预训练大模型的新范式 — tokenbender · 2026-08-01
- 【源头】新提的 Explorative Modeling?不过是重造了 avataRL 的轮子 — dejavucoder · 2026-08-01
- 【源头】探索式建模:开辟第三预训练轴,最高提升 6 倍采样效率 — _akhaliq · 2026-08-01
- 新范式 Explorative Modeling:为生成模型解锁第三预训练轴 — burny_tech · 2026-08-01
- 探索建模:发现参数与数据之外的第三大预训练维度 — sudoraohacker · 2026-08-01