24GB 显存党实测:Strata 量化 MoE 让 Qwen Flash 取代 27B 稠密模型
soyalemujica · reddit · 2026-10-03
一位 Reddit 用户分享在 7900XTX(24GB 显存)+ 64GB DDR5 的 Windows 11 本地配置上,用 Strata 跑 Qwen Flash 的体验:即使 250K 上下文也能跑到约 60 token/秒。
作者称其表现比此前的 27B 稠密模型更聪明、更精准,指令遵循和执行计划更可靠,前后端任务的测试都能胜任;q8 精度下可容纳更多上下文,且不再担心稠密模型 OOM。
其他细节:预留 6GB 显存给系统、Windows 11 下速度与 Linux 相当,可边跑 AI 边游戏。
「Infra」频道最新
- ERRC 用压缩通信省带宽补偿量化误差,加速张量并行 LLM 推理 — PyTorch · 2026-10-03
- 扩散起草加速 LLM 推理,SpecDiff 已达 5.5 倍提速且远未见顶 — nandofioretto · 2026-10-03
- 开发者平台宣布降价一半,GitHub Action runner 降至 12 倍便宜 — aniketmaurya · 2026-10-03
- TP=4 提速 5%:让 LLM 在 SM120 上启用 CustomAllReduce — TheZachMueller · 2026-10-03
- 手写 CuTe DSL Blackwell GEMM 达 1401 TFLOP/s,约 97% cuBLAS 水平 — retr0jirachi · 2026-10-03
- 图灵奖得主 Patterson:太阳能成本曲线近乎垂直下坠,将驱动奇点 — davidpattersonx · 2026-10-03