双 3090 跑 Qwen3.8-27B 本地编码,50-65 tok/s 是否正常?

sugarfreecaffeine · reddit · 2026-08-20

Reddit 用户分享双 RTX 3090(48GB 显存)在 Windows 10 上用 llama.cpp 本地运行 Qwen3.8-27B(unsloth 动态 Q6KXL 量化),用于本地 agentic coding。生成速度约 50-65 tokens/秒,偶降至 40 多,询问是否正常。帖子附完整 llama-server 启动命令,包含 262K 上下文、q80 KV cache、flash attention、MTP 投机解码等关键参数,可供本地部署用户参考对照。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →