12GB 显存跑 Qwen 3.8 27B 全上下文:两套 llama.cpp 配置分享
PyaesoneP · reddit · 2026-08-19
作者设备:RTX 5070 Ti Mobile(12GB)+ Ultra 9 275HX + 32GB DDR5,用 llama.cpp + CUDA 跑 Unsloth Qwen 3.8 27B UD Q4KXL,接受慢速换取能力,给出两套配置:
- agentic 编码(OpenCode):-ctx 262144、FFN 权重卸载到 CPU、flash attention、KV cache q80、MTP 投机解码;180K 上下文时约 1.5 t/s。这是他第一个敢让它碰真实项目的本地模型(仍限个人项目)。
- 个人助理(Hermes Agent):98K 上下文,约 9–11.5 t/s。相比之前的 MoE 模型(50–60 t/s 但经常无视 SOUL.md/MEMORY.md/USER.md 指令),Qwen 3.8 27B 指令跟随显著更稳,比吞吐更有价值。
社区分享的张量卸载技巧帮助很大;完整命令行参数见原帖。
「编程与Agent」频道最新
- 新增 СДАМ ГИА MCP 服务器,让 LLM 检索考试题库 — modelcontextprotocol · 2026-08-19
- 新增 Gate News MCP,整合加密货币新闻与情绪数据 — modelcontextprotocol · 2026-08-19
- 探讨可移植版本化知识库:是解药还是 RAG 的冗余封装? — Rebootz · 2026-08-19
- 开源项目 Easy Agent 从零复刻 Claude Code — tom_doerr · 2026-08-19
- 开发者实测 Grok Bot:替换 ChatGPT 的免费全栈 Agent 方案 — ns123abc · 2026-08-19
- 开发者实测:Cursor Agent 体验远落后 Codex,调用极慢 — NielsRogge · 2026-08-19