Qwen3.8-Flash-Next 低推理模式仍陷入无限思考
pabloodiablo · reddit · 2026-08-30
一位开发者在 2x 128GB 显存集群上测试 Qwen3.8-Flash-Next (Q8量化版) 时遇到了严重的性能问题。尽管将推理努力参数设为 low,模型在生成代码时仍陷入“无尽思考”状态,运行超过 45 分钟仍未停止(上下文达到 32k),生成量远超同类模型(Qwen3.8-27B 和 DeepSeek v4 均在 15 分钟内完成)。作者怀疑是 llama.cpp 配置或模型本身的问题,并寻求遇到过类似情况的社区帮助。
「模型」频道最新
- GLM-5.3-Flash 登顶 Agent Arena 榜单第四 — AccBalanced · 2026-09-01
- 智谱 GLM-5.3 Flash 推出 INT4 与 MXFP4 版本 — HaihaoShen · 2026-09-01
- 南贝格 4.2 3B 模型发布 DSpark 权重 — teortaxesTex · 2026-09-01
- Qwen 2.5 72B 本地实测:长上下文吞吐跌一半 — julianharris · 2026-09-01
- DeepSeek 等模型 SWE-bench 得分辟谣:未达 80% — teortaxesTex · 2026-09-01
- Celeris-1 Magnus 登场:称霸 τ³-bench 的 Agent 专用模型 — timshi_ai · 2026-09-01