微软新论文 Universal YOCO:递归计算高效扩展推理深度
donglixp · x · 2026-09-11
转帖引用了 arXiv 论文《Universal YOCO for Efficient Depth Scaling》(Yutao Sun、Li Dong、Furu Wei 等,微软亚洲研究院团队)。
论文要点:
- 问题:test-time scaling 提升了 LLM 推理与 agent 能力,但标准 Transformer 的循环缩放策略算力开销高、KV cache 随深度膨胀。
- 方法:YOCO-U 将 YOCO decoder-decoder 架构与递归计算结合,通过参数共享的 Universal Self-Decoder 多次迭代,且把迭代限制在浅层高效注意力层。
- 收益:YOCO 提供常数大小全局 KV cache 与线性 pre-filling,部分递归以有限开销增加表征深度,兼顾能力与推理效率。
- 结果:在通用与长上下文 benchmark 上保持强竞争力。
转发者 @scaling01 调侃「再叠一层 recurrent depth」,回复者给出论文链接。
所属事件:微软发布 Universal YOCO:递归计算高效扩展模型深度(3 条相关)→
「研究」频道最新
- DARPA 启动 expMath 计划,研究者分享数学猜想自动发现工作 — wellecks · 2026-09-11
- ETH 团队开源 VidMap:利用时序结构做视频三维重建,ECCV 2026 入选 — rsasaki0109 · 2026-09-11
- 中国 AI 智能体眼科诊所落地,Nature Medicine 总结真实世界经验 — EricTopol · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Caltech 本科生办 AI 数学竞赛遭质疑,组织者公开回应争议 — Singularitarian · 2026-09-11
- 前 NeurIPS 审稿人赞 YOCO:设计干净、消融扎实的好论文 — donglixp · 2026-09-11