Google 新论文 FLARE:注意力机制降耗 600 倍,或助力端侧大模型
dejanseo · x · 2026-08-01
有网友结合 Google 最新发布的论文 FLARE 推测,未来的 Gemini 4 可能会采用这一架构来提升长文本处理效率。
FLARE 论文核心要点:
- 优化目标:旨在解决 Transformer 架构在移动设备或 IoT 等资源受限的端侧设备上,处理长上下文时的高算力与内存瓶颈。
- 技术突破:提出了一种结合 FIRE 位置编码与 ReLU 激活函数的新方法,替代传统的 Softmax 和 RoPE。
- 硬件实测数据:在定制硬件上,相比 Softmax,FLARE 实现了 6 倍的运行频率提升,硅片面积缩小至 1/57,能耗大幅降低至 1/600。
这一研究标志着在资源受限设备上高效部署强大 LLM 迈出了重要一步。
「Infra」频道最新
- 塔塔集团拟与 ASML 合作,推进先进芯片设备在印度本地化制造 — prasanna_says · 2026-08-01
- 实测 3bit 27B 模型在强化学习中跑出可用速度 — cephaloform · 2026-08-01
- 斯坦福教授探讨高速互联技术:Scaling 趋势或将见顶 — jwt0625 · 2026-08-01
- SDNQ 量化引擎并入 Diffusers,支持多平台与 176 种量化类型 — RisingSayak · 2026-08-01
- 128GB Mac 硬塞 1.6TB 权重,Kimi K3 极限本地部署实测 — 机器之心 · 2026-08-01
- 传欧洲芯片巨头 NXP 拟收购自动驾驶 AI 芯片厂商 Ambarella — pstAsiatech · 2026-08-01