RTX 5060 Ti 实测:llama.cpp 跑 9B 模型 prompt 评估快约 30%
ngxson · x · 2026-10-06
开发者 ngxson 在 RTX 5060 Ti 上用 Q80 量化全本地运行 Clef Flash 9B,对比发现 llama.cpp 的 prompt 评估比 Ollama 快约 30%:约 3000 vs 2100 tokens/s,文本与单图输入差距相同。
他同时给出了可直接复制的启动命令(llama-server -b 8192 -hf ggml-org/Clef-Flash-GGUF:Q80 与 ollama run clef-flash:9b-q80),并推荐 ggml-org 在 Hugging Face 上的 Decision models 合集,内含 Clef、OpenJev、Laya 等多个 GGUF 模型与分类小模型。
所属事件:实测:llama.cpp 在 RTX 5060 Ti 上跑 9B 模型快约三成(2 条相关)→
「Infra」频道最新
- Nebius 涨价内存领涨 41%,芯片全面短缺开始写进云价目表 — tengyanAI · 2026-10-06
- GitHub Actions 再次大面积宕机,CI 流水线集体中断 — generativist · 2026-10-06
- 两台桌面 DGX Spark 跑起 462GB DeepSeek 模型,专家压到 2.77bit — Teknium · 2026-10-06
- 环保组织呼吁立即暂停在美国公共土地建设 AI 数据中心 — Polymarket · 2026-10-06
- KCoral:共享 GPU 池加速 agent 内核开发评测,吞吐提升 2.58 倍 — BeidiChen · 2026-10-06
- AI 基础设施扩张撞上瓶颈:企业 promised 的未来,电网没准备好 — DavidLinthicum · 2026-10-06