Kimi k3 RL 奖励设计曝光:按 rollout 长度加权基线
kastnerkyle · x · 2026-09-13
转引对 Kimi k3 训练细节的分析,两个关键点:
- 基线改造:放弃 GRPO 的组均值奖励作为方差缩减基线,改为按 rollout 长度 Lᵢ 加权的组基线 (R - (Σ RᵢLᵢ)/(Σ Lᵢ)),使 rollout 与 trainer 之间的数值动态更稳定。
- 成本-智能 Pareto 奖励:奖励只围绕成本(费用与 rollout 时间)和平均解题率两个维度设计,R = S - λe·C。超参 λe 取曲线在努力水平 e 处的斜率——取高或取低,模型只会沿曲线滑动而非推动前沿前移,以此把基模推向成本-智能 Pareto 前沿。
「研究」频道最新
- Flash-BoN 登 ECCV 2026:用墙钟时间换赛道,重定义扩散推理时缩放 — RisingSayak · 2026-09-13
- 生物学家批 AlphaFold 能力被高估:分布外蛋白表现严重不足 — lpachter · 2026-09-13
- IR 论文周报 Vol.173:谱压缩降 ColBERT 存储,Meta 用 MoE 扩展多模态嵌入 — _reachsumit · 2026-09-13
- Astra 与 Fable 仍在攻破 2025 年式简单对齐评测的变体 — Levitating · 2026-09-13
- TRL v1.13 发布:单节点 8 卡 H100 可训练超 100 万 token 序列 — SergioPaniego · 2026-09-13
- Yacine 反问:把 LLM 概念套进机器人论文真的靠谱吗 — yacineMTB · 2026-09-13