Kardashev-0.7:32 个模型联合强化学习训练成种群
Banbury Road 发布 Kardashev-0.7,宣称是全球首个由 32 个不同模型组成的强化学习训练群体。该项目采用名为 RLPS(Reinforcement Learning for Population Scaling)的方法,让互不相同的模型同场联合训练,探索「种群扩展」路径,使模型之间学到互补能力,而训练成本据称仅为常规方式的 0.7% 至 2%。
2026-10-06 ~ 2026-10-06 · 2 条相关
- Kardashev-0.7:首个由32个模型组成的RL训练群体,成本仅0.7%-2% — Scobleizer · 2026-10-06
- Banbury Road 发布 Kardashev-0.7:32 个模型同场 RL 联合训练 — MarceloDeAviz · 2026-10-06