线性注意力占大 batch 解码延迟 75%,读状态成瓶颈
sehoonkim418 · x · 2026-10-08
作者给出背景数据:在混合架构 LLM 中,大 batch 下线性注意力每步都要从显存读取完整循环状态,可占解码延迟高达 75%。ReplaySSM 通过缓冲更新、每多步窗口只写一次状态缓解了写入,但读取仍在——线性注意力仍占高达 53% 的延迟。
所属事件:线性注意力解码读状态占 75% 延迟,成混合 LLM 瓶颈(2 条相关)→
「Infra」频道最新
- 爆料:仅一款三星 HBM 满足英伟达 Vera Rubin 性能要求 — zephyr_z9 · 2026-10-08
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- 估值近 440 亿美元的数据中心公司 Firmus 澳交所 IPO 告急 — nordicinst · 2026-10-08
- DWDM 波长锁定精度收紧至 ±3.5GHz,OFC 后光互连规格再进化 — jwt0625 · 2026-10-08
- llama.cpp 新 PR 覆盖全部 26 种权重格式,Mac GPU 矩阵乘最高快 4.4 倍 — ggerganov · 2026-10-08
- Theo 算账:所谓 1.32 亿美元年 API 成本被夸大 44 倍,一年后或仅千美元 — dotey · 2026-10-08