让模型更易后训练:预训练新算法通过逆向梯度优化
ivan_bezdomny · x · 2026-07-31
探讨了开源模型在微调时的「可后训练性」差异,并介绍了一篇相关论文。论文提出,处于较浅损失曲面的模型更容易进行后训练。
为此,该论文提出了一种新的预训练算法:首先在当前策略附近找到使梯度逆向的最差策略,然后计算该最差策略处的梯度,最后将其应用到当前策略上。这种逆向寻优的方法旨在提升模型在后训练阶段的可塑性与优化效率。
「研究」频道最新
- LLM连破数学猜想引发学者信仰危机:我们究竟在做什么? — zetalyrae · 2026-07-31
- 拆解 DeepSpeed 引擎架构:如何用一个「上帝对象」安全控制复杂训练 — Mahmoud_Zalt · 2026-07-31
- M5Stack 开办强化学习机器人研讨会:从仿真到真机部署 — ShawnHymel · 2026-07-31
- 清华等提出 Cortex 框架,破解机器人长程任务执行难题 — jiqizhixin · 2026-07-31
- MegaLoc 图像检索模型登顶多榜单,支持任意场景定位 — rsasaki0109 · 2026-07-31
- 2bit量化版Qwen 35B通过Terminal-Bench智能体编码实测 — DavidBennett__ · 2026-07-31