双3090实测Qwen3.8-27B:20万上下文与F16 KV部署细节
Sisuuu · reddit · 2026-08-15
用户在双 RTX 3090 (24GB2) 上实测了 Qwen3.8-27B 的 Q8KXL 量化版,成功开启了 200K 上下文窗口,并保留了 F16 KV Cache 和视觉能力。文章详细解释了因混合架构(64层中16层全注意力+48层线性注意力)带来的内存节省与配置挑战,分享了针对 llama.cpp 的完整启动参数(含 Speculative Decoding 设置),并指出在当前硬件限制下,为保证稳定性需预留约 10% 的显存偏移空间,最终实现了代码 73 tok/s、散文 58 tok/s 的生成速度。
「Infra」频道最新
- Qwen 3.8 27B发布:本地运行AI新选择,或取代云服务 — Odd_Tumbleweed574 · 2026-08-15
- 应对HBM短缺:华为采用HBF宽内存等四项技术 — bookwormengr · 2026-08-15
- 算力电力受限,模型多路由带故障转移将成基建标配 — shensi · 2026-08-15
- batch-llama-benchy:本地模型批量基准测试工具 — LevelSoft1165 · 2026-08-15
- SpaceXAI投资大型水回收系统,每日循环1300万加仑废水 — XFreeze · 2026-08-15
- 英伟达 Rubin 数据中心毛利率将升至 78% — Beth_Kindig · 2026-08-15