RTX 5090 跑 Qwen 3.6 27B 实测:262k 上下文速度达 40 t/s
Gargle-Loaf-Spunk · reddit · 2026-08-08
一位开发者在 RTX 5090 上使用 llama.cpp 实跑了 Qwen 3.6 27B 模型(Q6K 量化),并分享了针对编码任务优化的启动参数。
性能表现
- 常规任务生成速度约 80-100 t/s。
- 在满载 262k 上下文时,速度会降至约 40 t/s。
- 模型刚好勉强塞进 5090 显存(未加载视觉模块,余量极小)。
关键参数调整经验
- Batch size:经过编码任务对比测试,最终将 -b 设为 512、-ub 设为 128 时性能最佳,比大众常用的更小数值表现更好。
- Reasoning budget:设为较高的 16384。作者发现调低该值容易导致模型在处理任务时“迷失”,尽管难以用标准化评测量化,但主观体验更稳定。
作者同时开启了 MTP 投机采样(--spec-type draft-mtp)等高级特性以榨干性能,并呼吁社区交流各自的配置心得。
「编程与Agent」频道最新
- Claude Managed Agents 更新:支持会话预算控制与暂停 — EricBuess · 2026-08-08
- AI 编码工具竞争焦点转向新开发原语 — HankYeomans · 2026-08-08
- MiniMax H3 C++/GGML实现性能基准:RTX 5090上10秒视频生成耗时119-130秒 — Acceptable-Cycle4645 · 2026-08-08
- 研究员用Claude零代码搭建个人网站,AI编程效率惊人 — CSProfKGD · 2026-08-08
- Agent 落地瓶颈:高并发生产中记忆与协调远比模型推理更关键 — SucceededMind · 2026-08-08
- Weaver编码代理更新至v.13:新增思考模式、BM25文件排名等功能 — 666Sayonara · 2026-08-08