千元主机跑 Qwen Flash Next:256GB 内存换来质量跃升但只剩 12tps
Positive-Stock6444 · reddit · 2026-08-30
Reddit 用户分享了在 2018 款 ThinkStation P520(Xeon W-2145、256GB DDR4 四通道、12GB 3060,总投入约 1000 欧元)上本地运行 Qwen 模型的实测对比。
Qwen3.6 35B A3B Q4KM(原日常主力):常驻内存约 20GB,prefill 约 400tps,生成 30-50tps,128k 上下文,且对机器上其他任务很宽容。
Qwen3.8 Flash Next UD-Q4KXL:常驻内存约 110GB,prefill 约 200tps,生成仅 12-15tps,上下文 65k——但输出质量「与 35B 是黑夜与白天的差别」。
关键发现:
- Flash Next 对内存争用极度敏感,机器上哪怕只跑 opencode 速度也会掉到 3-5tps,基本只能从另一台机器远程调用
- 合成随机内容的基准测试给出完全错误的性能结论,测 MoE 模型必须用真实上下文
- 文中附上两套完整 llama-server 启动命令,含 GPU 层数、CPU MoE 分配、量化 KV cache、MTP投机解码等全部参数,Flash Next 开放无限思考以保证质量
所属事件:发烧友实测本地跑 Qwen Flash Next:内存换质量但速度堪忧(2 条相关)→
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01