Banbury Road 发布 Kardashev-0.7:32 个模型同场 RL 联合训练
MarceloDeAviz · reddit · 2026-10-06
Banbury Road 宣布 Kardashev-0.7:用强化学习同时训练 32 个互不相同的模型组成「种群」,探索 Population Scaling——让模型间学到互补的专业分工,把「模型数量与协作」变成新的 scaling 维度。
作者提出一个有价值的评估问题:在相同总算力下,这种联合训练的种群相比各自独立训练再 ensemble 的模型群,到底能提升多少。这是把 RL 训练从单模型扩展到多模型协同的新尝试。
所属事件:Kardashev-0.7:32 个模型联合强化学习训练成种群(2 条相关)→
「研究」频道最新
- OpenAI 采纳 textGrain 文本水印技术,宾大团队宣布合作 — weijie444 · 2026-10-06
- CMU L3 实验室携 GradAlign 等论文亮相 COLM 2026 — wellecks · 2026-10-06
- LLM 水印统计框架:假设检验视角下可解出最优检测规则 — weijie444 · 2026-10-06
- 4DCodeBench 评测编程 Agent 用代码重建动态 3D 场景的能力 — CSProfKGD · 2026-10-06
- EMNLP 论文:LLM 从规则学新任务比从示例学更可靠 — najoungkim · 2026-10-06
- 新研究发现 Looped Transformer 可对参数知识做隐式推理 — hhsun1 · 2026-10-06