Qwen 3.8 Flash Next q2_0 在 6GB 显存老笔记本跑出 10 token/s
dampflokfreund · reddit · 2026-10-03
Reddit 用户 dampflokfreund 实测在 RTX 2060 笔记本(32GB 内存 + 6GB 显存)上用 Strata 引擎运行 Qwen 3.8 Flash Next q20(约 120B 参数):50K 上下文下解码速度约 10 token/s,prefill 近 100 token/s,远超预期。
- 命令:./START-HERE.bat --draft-vocab en --vram-reserve-mib 100 --kv q40
- 折衷:4-bit KV cache、无视觉能力;prefill 偏慢是主要瓶颈,处理长 prompt 仍需等待
- 对比:Qwen A35B A3B prefill 快约 5 倍,且可在不量化 KV cache 的情况下用 100K 上下文,尚不能完全替代
- 作者认为 Strata 引擎实至名归,值得期待后续优化
「Infra」频道最新
- Redis 作者 antirez 发布 DwarfStar 4:MIT 许可本地推理引擎,KV 缓存可落盘 — petrusenko_max · 2026-10-03
- 899 美元 Mac Mini M6 被当上网本,其实是 24 小时 agentic 计算机器 — hey_abusiddik · 2026-10-03
- Modal VM 沙箱正式 GA:一套流程跑起 Docker Compose 应用、测试与编码 Agent — charles_irl · 2026-10-03
- 793 人社区投票:oMLX 以 55.5% 成最受欢迎的 Apple MLX 引擎 — HankYeomans · 2026-10-03
- 本地 AI 用户吐槽:为什么大家都甘当「驯兽师」,忍受复杂的折腾流程 — kathi7 · 2026-10-03
- AI 网关成生产级 AI 栈关键控制层,八大核心能力盘点 — goyalshaliniuk · 2026-10-03