SkyRL v0.4 发布:16 张 B300 即可对 1T 参数 Kimi K2.7 做 RL 后训练
casper_hansen_ · x · 2026-10-03
开源 RL 后训练框架 SkyRL 发布 v0.4.0,重点在大规模后训练效率与稳定性。
- 超低门槛训练超大模型:通过 LoRA + INT4 推理服务 + 训练侧伪量化对齐训练/推理失配,1T+ 参数的 Kimi K2.6/2.7 现在只需 2 个 B300 节点(16 卡)即可跑单轮 RL,作者称多数后训练框架需要 16 个整节点且未必支持全上下文。
- 新模型支持:GLM 5.3 Flash、GLM 5.3(与 Trajectory 合作)、Kimi K2.6/2.7、Qwen3.8、Nemotron 3.5-Lightning。
- RL 稳定性:新增 Top-P 采样器重放,优化大 MoE 模型的 rollout router replay(R3)数据传输,来自 Lila Sciences 的 Dominic Yurk 贡献。
- 权重同步与吞吐:全 FP8/MXFP8 RL、Delta Weight Sync、基于 Ray Direct Transfer + NIXL 的分片权重传输、大规模 SFT 与 Tinker Server 扩展性改进。
所属事件:SkyRL v0.4 发布:16 张 B300 即可 RL 训练万亿参数模型(2 条相关)→
「编程与Agent」频道最新
- 基于 opencode v2 打造浏览器侧边栏:AI 直接运行脚本操控当前页面 — uwukko · 2026-10-03
- next-steps Claude 插件:专治并行跑 10 个 Claude 头晕 — daniel_mac8 · 2026-10-03
- Dot 主动预警:GitHub macos-14 runner 退役将致 CI 失败 — charliermarsh · 2026-10-03
- KNOWS:让 computer-use 智能体搜完网页直接产出 Google 文档 — anmarasovic · 2026-10-03
- AWS 开源 Strands Decider 2B:专做选择判断的 2B 决策模型 — amaarora · 2026-10-03
- 工程师用 Claude Opus 当对抗性审查员,化解团队代码冲突 — keyanzhang · 2026-10-03