Kimi K3 强化学习损失函数推导解析
brianryhuang · x · 2026-07-31
研究者 Manan Tomar 在推文中分享了关于 Kimi K3 模型强化学习(RL)损失函数的推导笔记。
他指出,该推导从镜像下降出发,代入计算 token 概率常用的 softmax 策略形式,自然推导出了对称的损失函数。该函数结合了截断机制以处理异步训练与推理不匹配的问题,并引入了 KL 惩罚来维持信赖域特性。作者赞赏了这种前沿模型采用有理论依据且简洁明了的方法,而无需依赖过多复杂的额外设计。
「研究」频道最新
- LLM为何有“Reddit味”?训练数据演变的三个时代 — ethayarajh · 2026-07-31
- 屏幕与摄像头隐蔽通信:AIRCODE 实现无感 1Mbps 传输 — deedydas · 2026-07-31
- 让模型更易后训练:预训练新算法通过逆向梯度优化 — ivan_bezdomny · 2026-07-31
- AlphaFold 预测精子-卵子融合复合物结构,堪称分子显微镜 — anshulkundaje · 2026-07-31
- LLM 智能体自主跑通 CT 重建研究,969 参数模型比肩 SOTA — maier_ak · 2026-07-31
- ACL 官方:5 月 ARR 元评审月底发布 — delliott · 2026-07-31