Mixtral-8x7B-AWQ部署踩坑:vLLM推理无限循环生成解析

Patentsmatter · reddit · 2026-08-13

开发者在 vLLM 0.27.1 环境中部署 Mixtral-8x7B-Instruct-v0.1-AWQ 量化版本时遇到了严重异常:模型在接收到常规提问后,会无视原意持续生成文本,直到耗尽 16384 的最大上下文长度。

作者贴出了启动命令、API 请求参数以及 CLI 的吞吐量日志。日志显示生成阶段的吞吐量达到 64 tokens/s,但最终因达到长度限制被强制截断。该无限生成问题仅在 Mixtral 模型上出现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →