RTX 5060 Ti 实测:Clef Flash 9B Q8_0 llama.cpp 快 30%

ngxson · x · 2026-10-06

ngxson 在 RTX 5060 Ti 上以 Q80 量化全本地运行 Clef Flash 9B,对比测试发现 llama.cpp 的 prompt 评估快约 30%:约 3000 tokens/s 对 2100 tokens/s,文本和单图输入上差距相同。

作者附上可直接复现的命令:llama-server -b 8192 -hf ggml-org/Clef-Flash-GGUF:Q80 与 ollama run clef-flash:9b-q80。

所属事件:实测:llama.cpp 在 RTX 5060 Ti 上跑 9B 模型快约三成(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →