DeepSeek V4 Flash 本地部署遇阻:输出被锁死 16k

El_90 · reddit · 2026-08-05

一位开发者在本地部署使用 DeepSeek-V4-Flash-0731 时遇到了输出长度限制问题。在使用 llama-server 进行本地推理时,即使将上下文长度设置到了 128k,模型的输出依然在达到 16k token 时被强制截断,并报错提示达到最大输出限制。

作者表示,这并非因为模型陷入了死循环,而是在处理“根据 PRD 文档实现整个项目”这种需要大量思考和规划的复杂任务时自然发生的。他推测这可能是该特定模型本身的硬性限制,并寻求社区的帮助与确认。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →