网友实测称 ExLlamaV3 被低估:同体积量化质量更高、更快
Embarrassed_Soup_279 · reddit · 2026-09-08
Reddit 用户发帖称本地推理后端 ExLlamaV3 (ExL3) 被严重低估:与 llama.cpp 相比,自测显示其量化质量更高、KLD 指标更低、速度更快(仅限 NVIDIA 卡)。近期新增 CPU MoE offload 可能是此前用户少的原因,之后更新频繁。
- 作者日常组合:tabbyAPI exl3 后端 + qwen3 27B SC 6bpw H6、qwen3 flash-next 4bpw
- 强调这只是个人测试集,不是标准基准
- 呼吁更多人关注并尝试该项目
「Infra」频道最新
- SemiAnalysis 首发第三方 TPU 推理基准:Ironwood 每美元性能最高领先 B200 50% — dylan522p · 2026-09-08
- 高通把 AI 算力塞进 GPU:Adreno Matrix Core 打破 NPU TOPS 十年叙事 — ryanshrout · 2026-09-08
- 预测市场开出 74% 概率:年内将有美国州立法暂停新建数据中心 — Polymarket · 2026-09-08
- 丹佛数据中心被拍到大面积浇草坪,150万居民却限水抗旱 — Polymarket · 2026-09-08
- 一篇长文构建分布式计算统一心智模型:K8s、Slurm、Ray、Spark — ArchitectingAI · 2026-09-08
- Aurora 网关修复 OpenCode API 更新引发的 HTTP 400 报错 — entitybtw · 2026-09-08