俄罗斯初创 Mostik 让大模型直连隐藏状态,成本降至 1/20
机器之心 · wechat · 2026-09-06
无名初创 Mostik 在 ARC-AGI-3 Kaggle 竞赛上一度冲到榜首,团队仅用四个月,含 12 位博士和菲尔兹奖得主 Stanislav Smirnov,参赛细节保密。
核心思路:模型间直接交换隐藏状态
- 现有多智能体系统靠文字传递,模型每生成一个 token 只输出约 17 比特,而内部状态约 2MB——像「在千维空间思考,只能通过钥匙孔说话」。
- Mostik 训练一座「桥」(唯一需训练的部分,两侧模型全部冻结),把 GLM-5.2(7530 亿参数)的隐藏状态翻译给 Qwen-3.5(40 亿参数),由小模型负责生成。
效果
- 混合系统成本仅为完整 GLM 的 1/20,准确率提升约 25%,小模型补上与大模型 50% 的能力差距;高难任务最高翻倍。
- 隐藏状态交接全面优于文字交接,最高领先 10 个百分点,且大模型交出越早优势越大。
延伸方向
- 可解释性新入口:对照发送/翻译/接收三方状态并做干预实验,可验证因果。
- 下一步把通道放进训练:蒸馏时教师实时指导学生、以及「专业化外挂」小模块,最终押注多模型协作的第三条路线。
结果均来自 Mostik 自己披露,复现细节未公开,通用性待外部验证。
「模型」频道最新
- Instagram AI 内容检测误标真实照片,用户陷入困惑 — emmanuelvivier · 2026-09-06
- Sam Altman 为 GPT-6 Astra「混乱」发布道歉,付费用户一度无法访问 — emmanuelvivier · 2026-09-06
- 用户实测 24 小时后称 Astra 被高估,不比 Opus 强多少 — Scobleizer · 2026-09-06
- tokenbender 吐槽:别听 yapper,新模型真值等实测 demo 说话 — tokenbender · 2026-09-06
- 澄清 GPT-6:模型家族而非单一模型,Astra 仅为旗舰首发 — mark_k · 2026-09-06
- GTA VI 玩家等不及了:用 GPT-6 从截图自制游戏 — Polymarket · 2026-09-06