Modal Clusters 正式上线:RDMA 节点按秒计费,一个装饰器起集群
josh_wills · x · 2026-10-02
Modal 宣布 Modal Clusters 正式可用(GA)。这是一个酝酿两年、内测一年半的新原语:用户通过一个装饰器 @modal.clustered(size=4, rdma=True) 即可即时拉起全球可用、RDMA 互联的多节点集群,按秒计费,无需自购硬件。
- 官方示例展示用 B300:8 GPU 定义训练函数,通过 cluster.containerips()、containerrank() 等接口获取分布式训练所需的 rank/world size 信息
- Clusters 与 Modal 现有原语无缝集成:checkpoint 写入 Volumes、数据经 Cloud Bucket Mounts 加载、用 Queues 编排任务
- 定位是让组织“拥有智能而不必拥有硬件”,支持 petaFLOP 级训练与大规模推理服务
作者 peywalt 是 Modal 工程师,回顾两年前立项时连自己都不太相信“按秒计费的 RDMA 集群”能做出来。
所属事件:Modal Clusters 正式 GA:装饰器即可启动 RDMA GPU 集群按秒计费(2 条相关)→
「Infra」频道最新
- a16z 拆解 AI 基建资金流向:每 100 美元 50 个进芯片,20 个进电力 — demian_ai · 2026-10-02
- 数据库老兵押注负载感知推理:批处理 LLM 任务可省大量重复计算 — sh_reya · 2026-10-02
- GPU 开销去哪了:训练、推理还是闲置? teams 的真实账单讨论 — Borges_Engineer · 2026-10-02
- SemiAnalysis:16% 的 Rubin 计算裸片面积耗在 HBM 控制器与 PHY 上 — BenBajarin · 2026-10-02
- Benchmark领投芯片初创Tendrils Compute,估值或超10亿美元 — Sethwinterroth · 2026-10-02
- 实测拆穿 Gufo 70 tok/s 宣传:重复词基准虚高,日常仅 39 tok/s — brainchillzZ · 2026-10-02