把 9 小时训练任务塞进一次权重更新:自训模型改为每周日迭代

cephaloform · x · 2026-09-09

作者分享自己训练模型的节奏调整:从每晚更新改为每周更新,让模型在周日休息做权重更新。

核心考量是样本量:每晚约 1.2K 个任务级奖励,一周累计 7.2K(实际可能达 8-10K),相比原来一次更新只有约一个任务样本,梯度信息量大得多。作者不想让模型基于单一样本就改变某个领域的行为,因此特意把「9 小时长程 babysitting 训练」这类大规模任务凑齐放进同一次更新。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →