RTX 5060 Ti 实测:Clef Flash 9B Q8_0 llama.cpp 快 30%
ngxson · x · 2026-10-06
ngxson 在 RTX 5060 Ti 上以 Q80 量化全本地运行 Clef Flash 9B,对比测试发现 llama.cpp 的 prompt 评估快约 30%:约 3000 tokens/s 对 2100 tokens/s,文本和单图输入上差距相同。
作者附上可直接复现的命令:llama-server -b 8192 -hf ggml-org/Clef-Flash-GGUF:Q80 与 ollama run clef-flash:9b-q80。
所属事件:实测:llama.cpp 在 RTX 5060 Ti 上跑 9B 模型快约三成(2 条相关)→
「Infra」频道最新
- Nebius 涨价内存领涨 41%,芯片全面短缺开始写进云价目表 — tengyanAI · 2026-10-06
- GitHub Actions 再次大面积宕机,CI 流水线集体中断 — generativist · 2026-10-06
- 两台桌面 DGX Spark 跑起 462GB DeepSeek 模型,专家压到 2.77bit — Teknium · 2026-10-06
- 环保组织呼吁立即暂停在美国公共土地建设 AI 数据中心 — Polymarket · 2026-10-06
- KCoral:共享 GPU 池加速 agent 内核开发评测,吞吐提升 2.58 倍 — BeidiChen · 2026-10-06
- AI 基础设施扩张撞上瓶颈:企业 promised 的未来,电网没准备好 — DavidLinthicum · 2026-10-06