Banbury Road 发布 Kardashev-0.7:32 个模型同场 RL 联合训练

MarceloDeAviz · reddit · 2026-10-06

Banbury Road 宣布 Kardashev-0.7:用强化学习同时训练 32 个互不相同的模型组成「种群」,探索 Population Scaling——让模型间学到互补的专业分工,把「模型数量与协作」变成新的 scaling 维度。

作者提出一个有价值的评估问题:在相同总算力下,这种联合训练的种群相比各自独立训练再 ensemble 的模型群,到底能提升多少。这是把 RL 训练从单模型扩展到多模型协同的新尝试。

所属事件:Kardashev-0.7:32 个模型联合强化学习训练成种群(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →