TUM 提出 Continuous Depth Batching,循环语言模型自适应推理提速 99%
TUM · hf · 2026-09-28
慕尼黑工业大学团队发布论文,解决循环语言模型(looped LM)深度自适应推理的批处理瓶颈。
- 背景:循环 LM 通过共享层循环多次,对"简单"token 少算、"困难"token 多算,但不同循环次数的 token 无法共享同一前向传播,标准批处理系统(如 vLLM)无法处理
- 方法:提出首个高效方案 Continuous Depth Batching(CDB),在循环步之间动态重组批次;动态调度循环与非循环部分,管理循环 KV 缓存,并提前预测哪些 token 将退出循环以异步准备批次
- 结果:在 Ouro 1.4B 和 Huginn 3.5B 上实验,发现全循环架构最适合深度自适应推理(循环核心外的大块非共享层会拖慢调度);CDB 实现了理论最大加速的最多 99%,进一步提升主要取决于模型架构与退出行为
「研究」频道最新
- 神经科学家驳「AI 非大脑」论:前沿模型表征已可预测灵长类皮层活动 — coherence · 2026-09-28
- ESPnet 发布百万级语音数据集 YODAS3,覆盖识别、翻译与合成 — espnet · 2026-09-28
- BoundInk 把字间边界作为显式生成单元,在线手写生成质量大幅提升 — SUNGKYUNARCH · 2026-09-28
- ARGUS 用 LLM 审计气候政策研究的因果识别假设,缺陷检出率 73% — Yonghong Zhang · 2026-09-28
- 用范畴论给深度学习画图:PyNCD 把 FlashAttention 画在餐巾上 — GioeleZardini · 2026-09-28
- 交互式实验室手动选下一个词,直观演示采样与温度机制 — CurieuxExplorer · 2026-09-28