Kardashev-0.7:首个由32个模型组成的RL训练群体,成本仅0.7%-2%
Scobleizer · x · 2026-10-06
Kardashev-0.7 宣称是全球首个由 32 个不同模型组成的训练化群体(swarm),采用名为 RLPS(Reinforcement Learning for Population Scaling)的强化学习方法训练。
关键点:
- 32 个模型在训练中自发形成专业化分工与互补能力,类似人类社会通过不同分工协作推进文明
- 以 0.007x0.02x 的推理成本、0.03x 的显存需求达到前沿模型性能
- 团队方向是「按模型数量扩展智能」,让模型群体学会互相叠加构建能力
所属事件:Kardashev-0.7:32 个模型联合强化学习训练成种群(2 条相关)→
「模型」频道最新
- SelfBench 用真实 GitHub PR 测编码模型:开源模型更贵还更弱 — ycombinator · 2026-10-06
- X 嵌入式 Grok 疑无按用户隔离上下文,被指严重产品失误 — altryne · 2026-10-06
- Liquid AI 发 d1 视觉版决策模型:比 GPT-6.1 便宜最多 200 倍 — JosephJacks_ · 2026-10-06
- Anthropic 审核员将威胁警局聊天上报,用户遭逮捕 — rohanpaul_ai · 2026-10-06
- flow-1 发布:RL 训练的 agent 轨迹纠错模型,比 GPT-6-sol 便宜 23 倍 — kalyan_kpl · 2026-10-06
- 首个 3B/8B 规模连续扩散语言模型:低步数推理质量保持更优 — ArashVahdat · 2026-10-06