单卡 RTX 5070 12GB 跑 177B 模型,实测 11-15 tok/s
ayobluestarr · reddit · 2026-10-03
作者在 12GB 显存的 RTX 5070 + 32GB DDR4 + Ryzen 5 5600GT 平台上,用基于 llama.cpp 的专家流式方案本地运行 Qwen3.8-Flash-Next 177B(UD-IQ3XS 量化),基准 11.5 tok/s(从原有方案的约 7 tok/s 提升),日常对话达 14-15 tok/s;长编码提示生成 4,892 token、10.15 tok/s,产出可玩的单文件贪吃蛇游戏。
主要优化手段:
- 修复 Windows I/O 队列深度问题,每个 worker 单独文件句柄
- 构建页锁定(page-locked)热专家层,让 GPU 更快拉取热点专家权重
- 输出对照控制模型做质量门控,基准用独立提示集构建热文件
GitHub 仓库公开了失败尝试、基准脚本与方法论,作者征求流式方面的进一步建议。
「Infra」频道最新
- 传 Terafab 目标年产 1 TW 算力,约为当前全球 AI 算力产出 50 倍 — XFreeze · 2026-10-03
- 单卡跑出 2200 prefill,消费级本地推理速度一周涨近十倍 — oran_ge · 2026-10-03
- Micron 称 NVHBM 可提升利润率,质疑者算账:价值流向了谁 — AccBalanced · 2026-10-03
- 三星全球首个做出10a级DRAM working die,2028量产IGZO晶体管 — zephyr_z9 · 2026-10-03
- 买家秀翻车:AliExpress 迷你主机 BIOS 里硬编码假 N150 型号 — Ok-Shower7286 · 2026-10-03
- Crusoe CEO 上 20VC:融资 64 亿美元谈数据中心、GPU 折旧与能源账 — 20VC · 2026-10-03