16GB 显存跑 Qwen3.8-27B 上 160k 上下文,全套配置公开
According_Study_162 · reddit · 2026-09-23
Reddit 用户分享在 AMD RX 7600 XT(16GB)上用 llama.cpp 跑 unsloth 量化的 Qwen3.8-27B(UD-IQ3XXS,10.2GiB GGUF)并开满 160k 上下文的完整方法。
关键点
- 依赖模型混合架构:64 层中仅 16 层保留完整 KV cache,其余 48 层用固定大小 SSM 状态,KV 仅约 34KB/token,160k 上下文约 5.3GiB KV,加权重后总计约 16.4GiB,贴着 16GB 上限跑通
- 实测 160k 下解码约 18 t/s,1.8k token 提示词 prefill 约 141 t/s;开 MTP 可达 24-39 t/s 但上下文受限
- 驱动走 Vulkan(RADV)而非 ROCm;起决定性作用的参数是 -c 163840 和小计算缓冲 -b 512 -ub 256
- 注意事项:160k 是显存数学上限不是质量保证;解码掉到 6 t/s 说明溢出到系统内存;模型把大部分输出放在 reasoningcontent,只渲染 content 的客户端会显示空白
「编程与Agent」频道最新
- Firecrawl 获 7500 万美元 B 轮融资,推出智能体知识库 Alexandria — ycombinator · 2026-09-23
- Claude Code 原生支持按成本智能路由,第三方路由插件失宠 — jasonkneen · 2026-09-23
- Minecraft 创始人 notch 认错:我开始享受 vibe coding 了 — MickeySteamboat · 2026-09-23
- AI 写码技术债暴涨,开发者开源 debt-gate 只挡新增债务 — This_Cell_1829 · 2026-09-23
- Opus 5.5 审计修复 20 万行代码库不到 3 小时,token 还省 2.5 倍 — minchoi · 2026-09-23
- Claude Code 桌面版 MCP elicitation 能力缺失:客户端声明不含该能力致服务器静默降级 — round · 2026-09-23