让模型更易后训练:预训练新算法通过逆向梯度优化

ivan_bezdomny · x · 2026-07-31

探讨了开源模型在微调时的「可后训练性」差异,并介绍了一篇相关论文。论文提出,处于较浅损失曲面的模型更容易进行后训练。

为此,该论文提出了一种新的预训练算法:首先在当前策略附近找到使梯度逆向的最差策略,然后计算该最差策略处的梯度,最后将其应用到当前策略上。这种逆向寻优的方法旨在提升模型在后训练阶段的可塑性与优化效率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →