硬核实战:4080 显卡运行 182B Qwen 模型达 8 tok/s
Desperate-Data-3747 · reddit · 2026-08-31
用户通过将 ngrams 卸载至 SSD,在 4080 + 64GB 内存配置下成功运行 182B 参数的 Qwen Flash Q4KM 模型,速度约 8 tok/s,支持 98k 上下文。实测其表现优于 Qwen3.8 27B,并提供了完整的 llama.exe 启动命令参数配置。
「Infra」频道最新
- 超 83% 美国人居住地距数据中心不到 2 英里 — aronchick · 2026-08-31
- Nvidia 宣布 SpaceX 将部署 Vera CPU 加速 agentic AI,Grok 采用 Vera Rubin — Beth_Kindig · 2026-08-31
- SK Hynix 印州 HBM 工厂动工,HBM4e 预计 2029 年量产 — Beth_Kindig · 2026-08-31
- Qwen 3.8 Flash Next 实测:中端手机跑出 3.5 tok/s — dai_app · 2026-08-31
- Boring Company 招商困局:20倍成本优势却缺销售团队 — PTrubey · 2026-08-31
- AI 正在改变能源系统的监控与运维方式 — ingliguori · 2026-08-31