FlashLoop:利用跨循环冗余加速 Looped Transformer,延迟降 1.65 倍
KyeGomezB · x · 2026-09-26
- Looped Transformer 通过重复循环实现更深计算而不增加参数,但每多一轮循环都增加计算量与 KV cache 开销,这也是许多人对其实用性的顾虑。
- Wanqi Yang 等人发现:跨循环中只有一小部分特征真正发生变化,存在大量冗余可挖。研究识别出三类计算冗余并加以利用来加速推理。
- 结果:延迟降低 1.65×,内存占用减少 6×。
- 已开源,pip install flashloop 即可使用。
「Infra」频道最新
- 最实用的 GPU 不是 N 卡 A 卡,是 300 美元 Intel Arc A310 — TheZachMueller · 2026-09-26
- Reddit 网友把图像生成搬进浏览器,3060 上 10 秒出像素画 — Bartholomheow · 2026-09-26
- 阿里发布平头哥真武 V900:单卡 216GB,2027 年一季度开售 — shashib · 2026-09-26
- llama.cpp 分支实现无损 prompt 去重,重场景省下数万 token — Odd_Cauliflower_8004 · 2026-09-26
- 用终端指挥 Agent,何必再租别人的服务器? — StewartalsopIII · 2026-09-26
- MIT 论文:scaling 法则到期,下次翻倍训练成本暴增 6 倍 — DavidLinthicum · 2026-09-26