SkyRL v0.4 发布:16 张 B300 即可 RL 训练万亿参数模型

开源 RL 后训练框架 SkyRL 发布 v0.4.0,重点提升大规模后训练的效率与稳定性。新版本借助 LoRA、INT4 推理服务与训练侧伪量化等技术,声称仅需 16 张 B300 GPU(2 个节点)即可对 1 万亿参数的 Kimi K2.7 进行全上下文强化学习训练,作者称这是目前显存效率最高的实现之一,大幅降低了对超大模型做 RL 后训练的硬件门槛。

2026-10-03 ~ 2026-10-03 · 2 条相关