Pluralis用14台消费级Mac完成RL后训练
Pluralis Research 发布了一项分布式强化学习(RL)后训练实验。该实验利用分布在4个国家的14台消费级Mac来负责生成rollout,并由另一台设备进行协同。这一实验展示了利用去中心化的消费级硬件集群进行大模型后训练的可行性。
2026-07-15 ~ 2026-07-16 · 2 条相关
- 用14台Mac跑RL后训练 — samsja19 · 2026-07-15
- 14台Mac完成RL后训练 — erfan_mhi · 2026-07-16