RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗
stochasticchasm · x · 2026-09-22
作者观察一次 RL 训练 run 的成本构成后指出,相对而言 grader(评判模型)消耗了大量算力,并好奇对方用的是哪个模型做 grader。他在回复中进一步分析:整个 run 只有 30 步,policy 在每步之间变化很大,因此或许值得对 grader 做重新 prefill(re-prefilling)以适配策略更新。属于对 RLHF/RLVR 训练工程中评估侧成本的碎片式技术讨论。
所属事件:RL 训练成本讨论:grader 算力开销与 KV cache 取舍(2 条相关)→
「研究」频道最新
- PyroDash:小模型按需呼叫大模型,推理成本降96%反超单独用大模型 — jiqizhixin · 2026-09-22
- 不改权重、18MB KV 缓存即可按请求移除 LLM 拒答行为 — Anony6666 · 2026-09-22
- AI 数学证明该按什么标准?Lean ≠ ZFC,规则变更没经过投票 — jessi_cata · 2026-09-22
- 剑桥学者 David Krueger:四大根本问题未解,AI 安全不能指望限期攻关 — DavidSKrueger · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22
- Eric Topol 撰文:AI 可在症状出现前数年精准识别阿尔茨海默高危人群 — EricTopol · 2026-09-22