vLLM 表示 prime-rl 在 28 台 H200 上跑万亿级 agentic RL
vllm_project · x · 2026-07-23
vLLM 团队介绍,Prime Intellect 的 prime-rl 0.6.0 正在 vLLM 上跑“万亿级”的 agentic RL。方案里用了 FP8、宽专家并行、prefill/decode 解耦、KV cache offloading,以及 vllm-router 等推理侧优化。
这套系统被用于在 SWE 任务上训练 GLM-5,序列长度达到 131k,并且在 28 台 H200 节点上把单步训练压到 5 分钟以内。帖子还顺带预告了 vLLM Office Hours 的直播,会详细讲 prime-rl 的性能和 vLLM 0.25 的新变化。
「Infra」频道最新
- Etched 估值冲到 103 亿美元,主打无 GPU 推理加速芯片 — TechCrunch AI · 2026-07-23
- 每日看板显示开源模型采用仍由中国和 Qwen 领跑 — natolambert · 2026-07-23
- DeepSeek-V4-Pro 在 Ascend 910C 训练中暴露长尾算子瓶颈 — teortaxesTex · 2026-07-23
- Besi 中国收入升至 8420 万欧元,占总营收 46% — zephyr_z9 · 2026-07-23
- LTX Desktop 1.1.0 让 Apple Silicon Mac 也能本地生成视频 — ltx_model · 2026-07-23
- AI agents 正把网页搜索变成新一轮基础设施市场 — Annual_Judge_7272 · 2026-07-23