753B 模型思考、4B 模型执笔:潜空间协作实现 20 倍提速

burny_tech · x · 2026-09-04

一条被广泛转发的讨论介绍了一种新的大小模型协作思路:753B 的大模型在潜空间中「思考」答案,再把信息传递给 4B 的小模型负责实际输出,两个模型之间不经过文本 token,而是直接在 latent space 通信。据称效果接近大模型本身,但速度快约 20 倍。davidad 顺带吐槽:当年 Transformer 还被叫做「decoder-only Transformer」,暗示这类架构思路正在回归。该说法来自第三方转述,细节与出处待核实。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →