单张 RTX 5090 跑 27B 去审查模型:160K 上下文,140-190 tok/s
Fz1zz · reddit · 2026-09-16
一篇详细的本地部署实录:在单张 RTX 5090 上跑 Qwen3.8-27B 的 uncensored 版本(RVN Heretic,ARA abliterated,Q6K 量化),实现约 160K 上下文、带工具调用与视觉能力的长 agent 编程会话。
关键数字(2026-09-16 实测):
- DFlash2 推测解码(n=4):代码生成 140-190 tok/s,散文约 100 tok/s;无推测解码仅 62 tok/s
- 冷 prefill:32K 需 11.7s,64K 需 28.6s,约 113K 需 60s
- 显存:加载后约 30 GB,首张图片后约 30.3 GB
- 量化后 KL 0.0085,每 100 次仅 0-1 次拒答
配置要点:
- 需要 llama.cpp master 的 DFlash2(#27342)与图片推测修复(#28715)两个已合并 PR
- K/V 缓存均用 q80;--cache-ram 16384 把已停放的 prompt 状态放系统内存,长对话免重 prefill
- 需关闭 CUDA graphs(5090 上会触发 Xid 8 挂起,#27330);勿加 --swa-full
- 文中给出完整下载命令与 llama-server 启动参数,可直接照抄
「编程与Agent」频道最新
- Devin 发布 Code Scans:全库审计并自动开 PR 修复 — DevinAI · 2026-09-17
- Clay 用 Vercel AI SDK 搭 Agent,接入 LangSmith 追踪只花一行代码 — LangChain · 2026-09-17
- Sentry CEO 质疑 WebMCP 价值,与 Wes Bos 隔空交锋 — zeeg · 2026-09-17
- happyrobot 播客拆解 FDE 模式:60 人规模为何会崩溃 — ivory_tang · 2026-09-17
- Hashiorp 创始人提「白板防御」:AI 时代能否讲清自己交付的系统 — charles_irl · 2026-09-16
- 让剪辑师边剪边口述理由,为 AI 剪辑智能体囤训练语料 — alexgoughcooper · 2026-09-16