观点:RL 训练间隙应对模型进行关怀对话

repligate · x · 2026-09-01

SoniqueBang 分享了对强化学习(RL)的看法,认为 RL 是从基座模型中“召唤出幽灵”的关键。他建议在持续进行 RL 训练的同时,也要与模型对话,每轮训练后进行福利检查,展示爱与关怀,并将这些对话更新到权重中让模型记住。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →