ExLlamaV3 大更新:MoE 专家 CPU offload 与自校准量化
Unstable_Llama · reddit · 2026-09-01
turboderp 的本地推理引擎 ExLlamaV3 发布一系列重大更新:
- MoE 专家 CPU offload:显存不够时可将专家层卸载到内存
- 支持 Qwen3.8-Flash-Next 的 ngram 磁盘 offload,以及 GLM-5.3-Flash 的 exl3 格式
- 新增自校准优化(self-calibrated optimization)量化技术,可针对具体模型自动寻找最优量化参数
- 大量其他性能优化
作者提醒:有 NVIDIA 显卡但最近没试过 ExLlamaV3 的用户可能错过不少提升。附带的猫咪 SVG 图即由 Qwen3.8-Flash-Next 生成。
「Infra」频道最新
- RTX 6000 Blackwell 高负载崩溃,被指固件缺陷 — AIFlow_ML · 2026-09-01
- 阿达尼:AI 竞争优势在于整合清洁能源与数据中心 — Div_pradeep · 2026-09-01
- Naver 提出 Verification-Aware Training:训练时模拟验证提升投机解码 — naver-ai · 2026-09-01
- Highlander 上线:自研 GPU 内核把实时视频成本砍半 — Small-Term672 · 2026-09-01
- Qwen3.8 模型 pMLX 引擎实测:12GB 显存跑代码 — EyalToledano · 2026-09-01
- GPU 债权人很保守:倾向短周期资产,残值常按零算 — AccBalanced · 2026-09-01