INT21 用 Agent 集群生成 Qwen3.8 训练器,吞吐超 PyTorch 11.5 倍
bingxu_ · x · 2026-09-08
INT21 发布了 SwarmOS 与 GPT-6 Astra 生成的 Rust/CUDA 全分片数据并行训练器,用于训练 27B 参数的 Qwen3.8 模型(Alibaba 8 月发布),该模型需分布在 8 张 NVIDIA B200 GPU 上训练。
关键结果
- 吞吐量比 eager PyTorch FSDP2 基线高 11.5×
- 比调优后的 PyTorch FSDP2 仍高 21.5%(调优可收窄大部分差距)
- Rust 运行时直接构建在 CUDA Driver API 上,GPU kernel 从预编译 CUBIN 二进制加载
核心论点
- Agent 能构建并持续改进严肃的训练基础设施,这是「系统软件生成」的又一步
- 「专一化即新优势」:为单一模型、单一目标、单一硬件配置定制的训练器,能胜过面向上千场景的通用框架
- 三个设计选择叠加收益:算子专用 CUDA kernel、消除通用抽象层、所有权驱动优化
- 这是其 Project Weaning 的一部分:从 AI 基础设施栈的每一层移除 Python,让 agent 端到端开发与维护训练系统
「Infra」频道最新
- Marigold V2 训练配方:4bit 量化 DiT 加 QLoRA 单卡微调 — AntonObukhov1 · 2026-09-09
- Magic 宣称预训练效率提升 50 倍:约 50 万美元复现 DeepSeek V4 Pro — magicailabs · 2026-09-09
- 45 万美元训练出前沿级法律模型 Thomson,数据策展成关键杠杆 — schwarzjn_ · 2026-09-09
- 高通确认 AWS 合作已计入 FY29 150 亿美元数据中心营收目标 — BenBajarin · 2026-09-08
- 数据中心建设开支半年暴增250亿美元,招聘岗位重回30万+ — AccBalanced · 2026-09-08
- 算力金融化狂飙:GPU租赁CDO或将上市 — AccBalanced · 2026-09-08