Gemma 加层后成功恢复训练

Desperate-Sir-5088 · reddit · 2026-07-12

作者更新了自己把 Gemma 模型“加层”后的第二次实验,目标是证明:即使对一个已经微调过的模型做较大改造,也不一定会把模型搞坏;它可以“恢复并学会新层”。

核心结论有三点:

训练分两轮:先冻结原模型,只训练新层,让新层“站稳”;再解冻全模型一起微调,让整体协同收敛。作者强调,这次实验的目标不是超过原模型,而是验证“对已微调模型做大手术后仍能恢复”是可行的。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →