1B模型媲美1.5倍数据量:全带宽Transformer架构
ProfBuehlerMIT · x · 2026-08-14
全带宽 Transformer 针对自回归模型解码时仅将采样 token 传给下一步、丢弃顶层隐藏状态的信息瓶颈提出改进。
- 核心机制:通过门控线性单元将上一步的顶层隐藏状态与当前 token 嵌入融合并反馈给底层,使模型能在内部进行非语言化的深度计算。
- 训练策略:采用计划多阶段目标,在预训练后期引入潜在反馈并混合小部分更深层的反馈步骤以保持稳定,同时保留了标准的 Transformer 架构和 KV cache。
- 实验效果:在 1B 参数、400B token 规模下,该架构显著改善了验证损失、数学与代码生成及指令微调性能。解码开销极小(<1%),其表现可媲美使用约 1.5 倍数据量训练的标准模型,且能在同等准确率下输出更短的推理轨迹。
「研究」频道最新
- 防大模型「背题」:新基准 REKEY 揭露视觉模型分数虚高 — jiqizhixin · 2026-08-14
- 长周期 AI 智能体的核心痛点:超越记忆的连续性问题 — Grimmoner · 2026-08-14
- Sponge Examples 攻击:可使神经网络能耗暴增百倍 — alexbilz · 2026-08-14
- 研究:模型越大越难解释并非定局,Steerling-8b 实现高可解释性 — juliusadml · 2026-08-14
- 探讨 LLM 架构:大词表如何缓解 Softmax 秩瓶颈 — kalomaze · 2026-08-14
- 研究:视觉推理跳过看图直接用工具,性能不降反升 — kwangmoo_yi · 2026-08-14