vLLM跑DeepSeek harness频繁爆上下文,llama.cpp反而稳24小时

cviperr33 · reddit · 2026-08-23

用户在 vLLM 上部署 Qwen3.8-27b 配合 DeepSeek Harness(DSH)做 agent 时频繁报 400 错误:模型最大上下文 115K,但 prompt 82K + 请求输出 32K 就超限。把上下文调到 142K、DSH 设 115K 仍无法正确压缩(compaction);Hermes harness 同样在压缩前崩溃。而用 llama.cpp 跑同一模型可 24 小时+ 无报错。作者附上了完整 vLLM 启动参数(tool-call-parser qwen3coder、prefix caching、speculative decoding 等),但不想把消息上下文压到 32K,因为模型经常需要长思考。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →