AWS 实战:用 SkyRL 在 HyperPod 上训 Qwen3-VL,迷宫通过率 43.75%→95%
AWS ML Blog · rss · 2026-09-26
AWS ML Blog 发布多模态 RL 后训练完整教程:在 SageMaker HyperPod 上用开源 RL 框架 SkyRL,以 GRPO 方法对 Qwen3-VL-8B 做视觉迷宫导航训练。
- 结果:从 VisGym SFT checkpoint 出发,GRPO 后训练把固定 64 迷宫评测集的解出率从 43.75% 提升到 95% 以上。
- 架构:3 个 GPU worker 节点(共 6 块 RTX PRO 6000 Blackwell)+ 1 个 CPU head 节点;FSDP 分片的策略模型与 6 个 vLLM rollout 引擎同卡混部,LoRA(rank 32)权重经 FSx for Lustre 共享存储同步。
- 基础设施:HyperPod 提供节点健康监控与自动替换、checkpoint 续训;Ray 集群从 SageMaker Studio 创建,指标自动进入 Grafana 仪表盘。
- 文章含可复现的 Dockerfile(锁定 SkyRL 与 VisGym commit SHA)、前提条件与部署步骤。
「Infra」频道最新
- 爆料称 DeepSeek 用 NVIDIA 游戏卡跑小模型推理,异构算力成焦点 — teortaxesTex · 2026-09-26
- xAI孟菲斯算力版图曝光:逾900亿美元投入、配3.3GWh特斯拉储能 — XFreeze · 2026-09-26
- 智能价格每年暴跌 13 倍,博主预测明年笔记本可跑 Opus 级模型 — LeviTurk · 2026-09-26
- 穆迪警告:Anthropic 与 OpenAI 表外债务已达 2.5 万亿美元 — SumitGup · 2026-09-26
- SemiAnalysis 绘制中国 60 余家运营商、1000+ 数据中心算力地图 — zephyr_z9 · 2026-09-26
- 托管都在降价,唯独审核成本暴涨:LessWrong 年烧百万美元 — jd_pressman · 2026-09-26