16GB显存跑27B:OpenCode+Qwen3.8本地编码完整配置教程

Due-Project-7507 · reddit · 2026-08-26

作者分享在 16GB 显存的笔记本 RTX A5000 上,用 exllamav3/tabbyAPI 跑 Qwen3.8-27B(exl3 量化) 配合 OpenCode 做小游戏的本地编码与网页浏览,模型在问几个澄清问题后可一次写成简单 HTML 游戏。

关键参数与性能:选用 3bpw 量化 + 6bit/5bit KV cache,配合 MTP 可达约 11 万 token 上下文;代码类解码速度约 55 token/s,MTP 帮不上忙的复杂计算场景约 10 token/s。不用 MTP 可改用 3.5 或 4bpw 换更长上下文。

文中给出从装驱动、Git、uv、tabbyAPI,到下载 exl3 模型、替换修正版 chattemplate.jinja、编写 config.yml(cachemode 6,5、maxbatchsize 1、MTP draft 模式 Q8、系统内存二级 KV cache 8192MB 等省显存选项)到启动服务与测速脚本的完整步骤。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →