OneLA 共享线性注意力状态,生成式推荐大束搜索解码提速 1.54-2.46 倍
_reachsumit · x · 2026-09-14
- 生成式推荐依赖大束搜索生成数百候选,现有线性注意力推理系统需为每个 beam 物化完整循环状态或反复重放历史,内存与流量开销大。
- OneLA 用单一共享的 prompt 派生状态加上各 beam 的紧凑追加式分歧记录来表示全部 beam 状态,仅计算当步所需状态信息;配合轻量祖先索引追踪各 beam 历史,beam 更新无需复制已有记录,并用融合 GPU kernel 跨 beam 复用共享状态。
- 端到端解码加速 1.54-2.46 倍,同时大幅降低循环状态内存与数据搬运。
「Infra」频道最新
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14
- 网友揪出光子公司宣传图破绽:整张芯片图是镜像拼接的 — jwt0625 · 2026-09-14
- 工程师质疑 DeepSeek 带火的 inline PTX 热潮:写汇编不等于高性能 — mike64_t · 2026-09-14
- M3 Ultra 本地跑 Qwen3.8-Flash-Next:预填充 559 t/s,解码 31 t/s — rm-rf-rm · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14