腾讯发布 FlashPrefill V2:长上下文推理加速方案
tencent · hf · 2026-08-21
腾讯发布了 FlashPrefill V2,这是一种针对长上下文 LLM 服务的块稀疏预填充注意力机制。通过均值校正的稀疏注意力、优化的 GPU 算子和框架集成,该方案在密集基线上实现了大幅加速,提升了长文本处理效率。
「Infra」频道最新
- 中港团队开源 Libra,智能体训练吞吐提升 3 倍 — jiqizhixin · 2026-08-21
- 开源 x402-cleanweb-agent:网页转 Markdown 省 80% Token — EstablishmentTough18 · 2026-08-21
- 预训练还有巨大优化空间,算力是唯一瓶颈 — zeeshanp_ · 2026-08-21
- 算力账本:宣称日处理 100T token 需要约 58 万张 GPU? — teortaxesTex · 2026-08-21
- 摩尔定律失效在即,非硅计算与新型架构将迎资本热潮 — MikePFrank · 2026-08-21
- 「不懂为什么要建数据中心,写快点内核不就行了」 — basedjensen · 2026-08-21