单卡 RTX 5070 12GB 跑 177B 模型,实测 11-15 tok/s

ayobluestarr · reddit · 2026-10-03

作者在 12GB 显存的 RTX 5070 + 32GB DDR4 + Ryzen 5 5600GT 平台上,用基于 llama.cpp 的专家流式方案本地运行 Qwen3.8-Flash-Next 177B(UD-IQ3XS 量化),基准 11.5 tok/s(从原有方案的约 7 tok/s 提升),日常对话达 14-15 tok/s;长编码提示生成 4,892 token、10.15 tok/s,产出可玩的单文件贪吃蛇游戏。

主要优化手段:

GitHub 仓库公开了失败尝试、基准脚本与方法论,作者征求流式方面的进一步建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →