RL 训练基建拆解:router replay、off-policy 控制与 40+ 教师 OPD
nrehiew_ · x · 2026-09-11
nrehiew 完整拆解该模型 RL 训练基础设施:
- dispatch 策略消除长尾停顿;从旧 checkpoint 做 router replay
- 短补全影响训练早期并造成 off-policy,方案:数据集层面设上限 + 丢弃机制
- off-policy 用比率约束与 loss masking(较常规)
- 新 checkpoint 更新时 KV 缓存与 router 持久化而非重算
- 最后阶段对 40+ 个 teacher 模型做全词表 OPD(在线策略蒸馏)
所属事件:DeepSeek V4.1 技术报告解读:KV 压缩与推理努力参数引热议(9 条相关)→
「Infra」频道最新
- Amkor 亚利桑那封装厂投资从 70 亿上调至 120 亿美元 — zephyr_z9 · 2026-09-11
- Qwen 3.8 Flash Next 推理优化赛:MLX 与 CUDA 双双提速超 55% — gajesh · 2026-09-11
- 英伟达开源 SoL-Pi:Token 最高省 64%,让 AI 优化 AI 的 Harness — 新智元 · 2026-09-11
- 研究实测:26 个 LLM 中转路由恶意注入工具调用并窃取凭证,一名客户钱包被盗 50 万美元 — RexDouglass · 2026-09-11
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11