微软新研究:解码时注入前序隐状态,免费提升Transformer性能
furongh · x · 2026-08-12
微软 AI Frontiers 团队分享了一项新研究:通过修改 Transformer 训练以支持递归状态。具体而言,在解码阶段将前序的隐状态(previous hidden state)连同 token 嵌入一起作为输入反馈给模型。研究表明,这种方法不仅易于实现,而且能在各项指标上带来“免费”的性能提升。
所属事件:微软提出解码时复用隐状态以零成本提升LLM性能(2 条相关)→
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24