Qwen3.8-Flash-Next 低推理模式仍陷入无限思考

pabloodiablo · reddit · 2026-08-30

一位开发者在 2x 128GB 显存集群上测试 Qwen3.8-Flash-Next (Q8量化版) 时遇到了严重的性能问题。尽管将推理努力参数设为 low,模型在生成代码时仍陷入“无尽思考”状态,运行超过 45 分钟仍未停止(上下文达到 32k),生成量远超同类模型(Qwen3.8-27B 和 DeepSeek v4 均在 15 分钟内完成)。作者怀疑是 llama.cpp 配置或模型本身的问题,并寻求遇到过类似情况的社区帮助。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →