Miles 为 DeepSeek-V4.1-Flash 提供 Day-0 RL 支持,KL 仅 0.0012–0.0017
ying11231 · x · 2026-09-10
radixark 宣布其 RL 训练框架 Miles 首日支持 DeepSeek-V4.1-Flash,关键做法:
- 训练器与 SGLang 的采样逻辑保持接近,通过并行设计与共享状态让新架构在 GPU 间完整扩展
- 量化感知训练对齐 SGLang 的 FP4/FP8 舍入;routing replay 复用 rollout 的专家选择
- 用 FP32 与确定性归约保证数值一致性,训练与 rollout 同位部署,在 16 张 GPU 上完成全参数 RL
在 DAPO 运行的 0–80 步中,trainer–rollout 每 token KL 保持在 0.0012–0.0017,奖励从 0.51 升至 0.78。博客与 cookbook 见评论区。
「Infra」频道最新
- 一天烧 40 亿 token,14 次按键把账单砍 500 倍,作者担忧 5 万亿美元债务 — gaganghotra_ · 2026-09-10
- DeepSeek 稀疏化新动向:token 效率看齐 OpenAI,告别「胖鲸吃白饭」 — teortaxesTex · 2026-09-10
- Acellera 实测:单张 RTX 5090 跑本地模型做药物发现 — gdefabritiis · 2026-09-10
- Mac mini 实测:35B 本地运行时达 Haiku 水准,但不适合 Agent — PawelHuryn · 2026-09-10
- 数据中心是一个符号:拆解反数据中心叙事背后的情绪 — ShakeelHashim · 2026-09-10
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10