Miles 为 DeepSeek-V4.1-Flash 提供 Day-0 RL 支持,KL 仅 0.0012–0.0017

ying11231 · x · 2026-09-10

radixark 宣布其 RL 训练框架 Miles 首日支持 DeepSeek-V4.1-Flash,关键做法:

在 DAPO 运行的 0–80 步中,trainer–rollout 每 token KL 保持在 0.0012–0.0017,奖励从 0.51 升至 0.78。博客与 cookbook 见评论区。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →