实测:Qwen3.8-Flash-Next 速度快但在复杂推理中会“假死”
trashacct383 · reddit · 2026-08-31
作者在单卡 RTX 6000 Blackwell 上对 Qwen3.8-Flash-Next-NVFP4 与 Qwen3.8-27B-FP8 进行了本地对比评测,测试场景包括文本评分、记忆整合、深度研究等实际工作流。
结论:
- Flash-Next: 速度更快(约 177 tok/s),在严格 JSON 输出、注入防护、SLA 合规性方面零失误,在空间推理和代码生成的高阶任务中表现更好。
- 27B 密集版: 在持续多步符号推理(如修 Bug、数学证明)中依然胜出。
- 新问题: Flash-Next 出现了一种新的失败模式:承诺完成任务并声明“done”,但随后不输出任何内容。两者不能直接互相替换。
部署细节:
文章提供了详细的 vLLM Docker 配置指令,涉及 CPU Offload、MTP ( speculative decoding )、xgrammar 等参数设置。
「Infra」频道最新
- SK hynix 赴美建厂:HBM 供应链走向局部本土化 — pstAsiatech · 2026-08-31
- 独家:SK海力士拟将HBM4E基础裸片部分外包英特尔代工 — BenBajarin · 2026-08-31
- Rayrun 推出 sPTC 技术,AI 响应速度提升 20% — lucgagan · 2026-08-31
- 网友想把 1.25bit 量化方案搬到 Qwen3.8-Flash-Next — TemperatureOk3561 · 2026-08-31
- 三星 HBM4 领跑,SK 海力士/美光遇阻 — AccBalanced · 2026-08-31
- R9V:RDNA4 定制内核跑 Qwen3.8 吞吐量提升 30 倍实测 — Public_Umpire_1099 · 2026-08-31