Fireworks meetup 实操分享:Kimi K3 上的持续 RL 后训练怎么调

anbarth · x · 2026-08-17

AI Performance Engineering Meetup 将举办线上分享(8月17日9am PDT),由 Fireworks.ai 的 Sinan Ozdemir 主讲「Rollout, Reward, Update, Repeat: How Fireworks Optimizes Continuous Post-Training」。

内容将围绕在 Kimi K3 上用 Fireworks serverless API 跑一场后训练 RL 会话展开,讨论算法选择、损失函数、LoRA rank、超参数与奖励设计之间的相互作用——以及它们如何决定模型能否真正学到东西。作者强调,让 RL 在生产中持续跑起来的关键在于数据管道和学习环境的设计。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →