16GB 显存跑 Qwen3-27B:pi.dev 上下文压缩插件踩坑求助

darksteelsteed · reddit · 2026-09-13

作者在 RTX 5080 16GB 上用 llama.cpp 跑 nvfp4 量化的 Qwen3.8-27B(48k 上下文、约 12 t/s),但 pi.dev 的上下文压缩时机不对导致模型提前停止。尝试过的插件:

作者还吐槽 pi.dev 架构问题:压缩设置与模型设置完全分离,切换模型(如换 gemma、其他 Qwen)就得重配;且多数插件面向前沿模型的长上下文,不适合因显存不足而窗口较小的本地模型,征求针对性建议。帖内含完整 llama-server 启动参数,对低显存本地部署有参考价值。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →