RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗

stochasticchasm · x · 2026-09-22

作者观察一次 RL 训练 run 的成本构成后指出,相对而言 grader(评判模型)消耗了大量算力,并好奇对方用的是哪个模型做 grader。他在回复中进一步分析:整个 run 只有 30 步,policy 在每步之间变化很大,因此或许值得对 grader 做重新 prefill(re-prefilling)以适配策略更新。属于对 RLHF/RLVR 训练工程中评估侧成本的碎片式技术讨论。

所属事件:RL 训练成本讨论:grader 算力开销与 KV cache 取舍(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →