实测 Qwen3.8-27B 在 16GB 显存下的 13 万上下文性能
BuffMcBigHuge · reddit · 2026-08-20
作者在 RTX 4080 16GB 上测试了 Qwen3.8-27B 模型的长上下文性能。通过使用 llama.cpp 的 DFlash2 分支、ngram-mod 采样策略以及 MTP (Medusa Thought Proposal) 推测解码技术,成功在保持推理速度的同时将上下文长度扩展至 131k。文章对比了不同配置(如 IQ3XXS 量化、缓存设置)的效果,并提供了完整的启动命令参数。
「Infra」频道最新
- Cursor 深度拆解:20 年 Git 基础设施演进,将存储当数据库设计 — omojumiller · 2026-08-20
- NVIDIA DGX Station 实测:Qwen3.8-27B 推理达 2713 tok/s — NVIDIAAI · 2026-08-20
- 欧央行博客预测 AI 市场即将迎来修正 — marigo · 2026-08-20
- S&P 数据称五大巨头 2027 年现金流或亏 1250 亿 — marigo · 2026-08-20
- 单卡 5090 跑 KIMI K3 达 5t/s 是否可行? — MLDataScientist · 2026-08-20
- 日耗 1 元无法忍受,流量激增后迁出 Cloudflare Workers — ezshine · 2026-08-20