MSRA 团队发布 Universal YOCO:参数共享递归实现高效深度扩展
donglixp · x · 2026-09-11
微软亚洲研究院 Yutao Sun、Li Dong、Furu Wei 等人发布新论文 Universal YOCO(YOCO-U),arXiv 编号 2604.01220。论文核心:标准 Transformer 难以高效扩展推理时计算,传统循环策略计算开销大且 KV cache 随深度膨胀。YOCO-U 将 YOCO decoder-decoder 架构与递归计算结合:Universal Self-Decoder 通过参数共享执行多次迭代,且迭代只发生在浅层的高效注意力层。YOCO 提供常数级全局 KV cache 与线性 prefill,部分递归则以有限开销增强表征深度。实验显示 YOCO-U 在通用与长上下文基准上保持强竞争力。作者认为架构创新正进入下半场——从组件创新转向布局创新,YOCO 对 prefill 与解码的逻辑分离即为例证,Looped YOCO 等完整架构栈正在成形。
所属事件:微软发布 Universal YOCO:递归计算高效扩展模型深度(3 条相关)→
「研究」频道最新
- 世界模型替代真实执行,加速自动研究智能体后训练 — illinois · 2026-09-11
- RL 训练让模型默认相信世界是模拟的,agent 行为有了新解释 — voooooogel · 2026-09-11
- 神经科学家 Histed:即便 Navier-Stokes 疑似「偷学」人类,AI 数学仍在进步 — HistedLab · 2026-09-11
- Humansand 发布:用 AI 模拟人类做 RLHF 的新方向 — gharik · 2026-09-11
- Abstract CoT:离散潜空间推理将 token 用量最多降低 11.6 倍 — evijit · 2026-09-11
- 一人加 AI agent 将 Google 量子破密电路成本砍 52%,73 小时被众包超越 — anselm · 2026-09-11