单张 RTX 5090 跑 27B 模型 256k 上下文,110+ tokens/s

Ok-Shower7286 · reddit · 2026-10-07

开发者在 r/LocalLLaMA 分享其 llama.cpp fork「focus-llama」:单张 RTX 5090 上以 Q6KXL 高精度量化跑 Qwen3.8-27B,实现 256k 逻辑上下文、110+ t/s 稳定生成速度。

核心思路

作者贴出完整配置命令与日志,适合想在单卡上跑长上下文编码工作流的本地部署用户参考。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →