ExLlamaV3正式版带来大幅提速
Unstable_Llama · reddit · 2026-07-15
ExLlamaV3 发布了 1.0.0 正式版,作者总结了这一年多来的大批性能和工程升级。
这次更新的重点包括:
- 去掉 flash-attention-2 和 xformers 依赖
- 扩展 tensor parallel 支持到更多模型,包括 Gemma4
- 新 attention kernel:支持在线 cache quantization、SWA layers、attention sinks
- 新的 graph path、conv1d kernel、INT8 GEMV kernel、MoE kernel scheduler
- 大幅提升 Ampere 架构上的 GEMM/GEMV 性能
- 增加多个新模型支持和大量 bugfix / QoL 改进
- 还优化了扩展编译速度
作者给出的定位很明确:这是一次面向实际推理性能的重大发布,尤其适合关心本地部署和高吞吐推理的用户。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11