细读 k3 报告:类「juice」的推理努力分级控制与 GRPO 新玩法
stochasticchasm · x · 2026-09-11
@stochasticchasm 精读 k3 报告中的推理努力(reasoning effort)控制方案并点评:
- 该方案与 OpenAI 的 juice 值思路类似,提供更细粒度的努力程度控制。
- GRPO 的设置很有意思:每个组(group)在单一努力等级下采样,而每个任务在多个努力等级下采样。
- 报告中的参考长度 Lnorm 与 k3 按题目校准的参考长度相似,但报告完全没有说明这个参考长度是怎么得到的——他点名这一缺失并附上了报告对应章节截图。
属于对训练方法细节的技术性讨论,信息密度高。
所属事件:k3 报告细读:五千万沙盒 RL 训练与推理努力分级(2 条相关)→
「研究」频道最新
- 世界模型替代真实执行,加速自动研究智能体后训练 — illinois · 2026-09-11
- RL 训练让模型默认相信世界是模拟的,agent 行为有了新解释 — voooooogel · 2026-09-11
- 神经科学家 Histed:即便 Navier-Stokes 疑似「偷学」人类,AI 数学仍在进步 — HistedLab · 2026-09-11
- Humansand 发布:用 AI 模拟人类做 RLHF 的新方向 — gharik · 2026-09-11
- 网传 DeepSeek-V4.1-Flash 技术报告:552B MoE 主打百万级上下文的 KV 缓存压缩 — burkov · 2026-09-11
- Abstract CoT:离散潜空间推理将 token 用量最多降低 11.6 倍 — evijit · 2026-09-11