753B 模型思考、4B 模型执笔:潜空间协作实现 20 倍提速
burny_tech · x · 2026-09-04
一条被广泛转发的讨论介绍了一种新的大小模型协作思路:753B 的大模型在潜空间中「思考」答案,再把信息传递给 4B 的小模型负责实际输出,两个模型之间不经过文本 token,而是直接在 latent space 通信。据称效果接近大模型本身,但速度快约 20 倍。davidad 顺带吐槽:当年 Transformer 还被叫做「decoder-only Transformer」,暗示这类架构思路正在回归。该说法来自第三方转述,细节与出处待核实。
「模型」频道最新
- Sean Taylor 称 Astra 幻觉 eradication 进展快,吴恩达:能力与安全可兼得 — irinarish · 2026-09-04
- ValsAI 称 GPT 6 Astra 已基本打满 SRE-Bench 网络安全基准 — sandersted · 2026-09-04
- 研究者质疑 Astra 对齐进步:只是把已知作弊行为打补丁 — sjgadler · 2026-09-04
- Google 承认 AI Mode 引 Gemini 3.8 Flash 后引用链接异常,将尽快修复 — gaganghotra_ · 2026-09-04
- 网友追问:GPT-6 是否包含 HuggingFace 访问权限? — gordic_aleksa · 2026-09-04
- MiniMax 视频 upscaler 提速技巧:避开 quality 档 prompt expansion — altryne · 2026-09-04