Qwen 3.8 Flash Next q2_0 在 6GB 显存老笔记本跑出 10 token/s

dampflokfreund · reddit · 2026-10-03

Reddit 用户 dampflokfreund 实测在 RTX 2060 笔记本(32GB 内存 + 6GB 显存)上用 Strata 引擎运行 Qwen 3.8 Flash Next q20(约 120B 参数):50K 上下文下解码速度约 10 token/s,prefill 近 100 token/s,远超预期。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →