RTX 5060 Ti 实测:llama.cpp 跑 9B 模型 prompt 评估快约 30%

ngxson · x · 2026-10-06

开发者 ngxson 在 RTX 5060 Ti 上用 Q80 量化全本地运行 Clef Flash 9B,对比发现 llama.cpp 的 prompt 评估比 Ollama 快约 30%:约 3000 vs 2100 tokens/s,文本与单图输入差距相同。

他同时给出了可直接复制的启动命令(llama-server -b 8192 -hf ggml-org/Clef-Flash-GGUF:Q80 与 ollama run clef-flash:9b-q80),并推荐 ggml-org 在 Hugging Face 上的 Decision models 合集,内含 Clef、OpenJev、Laya 等多个 GGUF 模型与分类小模型。

所属事件:实测:llama.cpp 在 RTX 5060 Ti 上跑 9B 模型快约三成(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →