网友实测称 ExLlamaV3 被低估:同体积量化质量更高、更快

Embarrassed_Soup_279 · reddit · 2026-09-08

Reddit 用户发帖称本地推理后端 ExLlamaV3 (ExL3) 被严重低估:与 llama.cpp 相比,自测显示其量化质量更高、KLD 指标更低、速度更快(仅限 NVIDIA 卡)。近期新增 CPU MoE offload 可能是此前用户少的原因,之后更新频繁。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →