3 块 3060 矿卡跑 FlashNext:strata 达 38-40 t/s 完胜 llama.cpp
MD_Reptile · reddit · 2026-10-04
Reddit 用户用三块二手 3060 12GB 矿卡搭开放矿架跑本地大模型,实测 FlashNext(配合 strata)在 IQ3 量化下达到 38-40 tokens/s,而 llama.cpp 同条件下只有 13.2 t/s,差距近 3 倍。
配置细节:Kingwin 8 卡矿架(叠放在 unraid 服务器上)、Asus prime z370p 主板、8 代 i7、64GB DDR4、1000W 电源。作者认为老矿卡跑新模型性价比很高,征集其他用旧矿卡本地部署的经验。
「Infra」频道最新
- RWKV-7 G1k 发布:纯 RNN 无 KV cache,13B 推理仅靠 16M 状态 — cephaloform · 2026-10-04
- 16GB 显存跑 27B 模型:NInfer 4080 推理引擎实测 262 tok/s — roofkid · 2026-10-04
- NeoCloud Summit 2026 将在旧金山办,GPU 原生云生态全员到齐 — AccBalanced · 2026-10-04
- Modal 工程师复用 K8s Reconciler 模型造 Gang Scheduler — emilyzsh · 2026-10-04
- 面对数据中心抗议潮,AWS CEO 称亚马逊已不再使用保密协议 — TechCrunch AI · 2026-10-04
- 密码学专家观察:OpenAI 疑似正在再次进行气隙隔离的 RL 训练 — matthew_d_green · 2026-10-04