Exllamav3 实测碾压 Llama.cpp,双 3060 推理速度倍增

Ecstatic-Wash-7667 · reddit · 2026-08-17

用户在双 RTX 3060 显卡配置下对比了 Exllamav3 和 Llama.cpp 的性能。测试覆盖 Qwen 3.8 27b 和 Qwen 3.6 35b 两个模型,进行 3 次冷启动基准测试。结果显示 Exllamav3 在 tokens/sec (tg) 指标上显著优于 Llama.cpp,差距在特定测试中极为悬殊。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →