14台Mac完成RL后训练

erfan_mhi · reddit · 2026-07-16

Pluralis Research 发布了一次分布式 RL post-training 实验:14 台分布在 4 个国家的消费级 Mac 负责生成 rollout,另一台位于别处的 B200 负责 bf16 梯度更新。

关键做法

结果

他们在 PaperSearchQA 这个多轮生物医学检索任务上测试 Stoa:

结论与后续

作者强调,这说明消费者硬件也能承担大头 rollout 成本;如果把这套 Stoa 和此前在数百台消费 GPU 上做预训练的 Agora 结合,可能把更大规模的推理与训练进一步搬到用户自有硬件上。

所属事件:Pluralis用14台消费级Mac完成RL后训练(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →