24GB 显存党实测:Strata 量化 MoE 让 Qwen Flash 取代 27B 稠密模型

soyalemujica · reddit · 2026-10-03

一位 Reddit 用户分享在 7900XTX(24GB 显存)+ 64GB DDR5 的 Windows 11 本地配置上,用 Strata 跑 Qwen Flash 的体验:即使 250K 上下文也能跑到约 60 token/秒。

作者称其表现比此前的 27B 稠密模型更聪明、更精准,指令遵循和执行计划更可靠,前后端任务的测试都能胜任;q8 精度下可容纳更多上下文,且不再担心稠密模型 OOM。

其他细节:预留 6GB 显存给系统、Windows 11 下速度与 Linux 相当,可边跑 AI 边游戏。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →