实测:Qwen3.8-Flash-Next 速度快但在复杂推理中会“假死”

trashacct383 · reddit · 2026-08-31

作者在单卡 RTX 6000 Blackwell 上对 Qwen3.8-Flash-Next-NVFP4 与 Qwen3.8-27B-FP8 进行了本地对比评测,测试场景包括文本评分、记忆整合、深度研究等实际工作流。

结论:

部署细节:

文章提供了详细的 vLLM Docker 配置指令,涉及 CPU Offload、MTP ( speculative decoding )、xgrammar 等参数设置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →