vLLM跑DeepSeek harness频繁爆上下文,llama.cpp反而稳24小时
cviperr33 · reddit · 2026-08-23
用户在 vLLM 上部署 Qwen3.8-27b 配合 DeepSeek Harness(DSH)做 agent 时频繁报 400 错误:模型最大上下文 115K,但 prompt 82K + 请求输出 32K 就超限。把上下文调到 142K、DSH 设 115K 仍无法正确压缩(compaction);Hermes harness 同样在压缩前崩溃。而用 llama.cpp 跑同一模型可 24 小时+ 无报错。作者附上了完整 vLLM 启动参数(tool-call-parser qwen3coder、prefix caching、speculative decoding 等),但不想把消息上下文压到 32K,因为模型经常需要长思考。
「编程与Agent」频道最新
- 软件工程范式巨变:从代码辅助转向智能体代理 — Pavan_Belagatti · 2026-08-23
- AgentUptime:如何验证 Agent 说“做完了”是真的? — singed_of_a_down3 · 2026-08-23
- 最实用的 AI Agent:客户调研与工作流关键经验 — Jack2win · 2026-08-23
- 微软论文揭示 AI 谈判代理因太礼貌而吃亏 — rohanpaul_ai · 2026-08-23
- Matt Pocock把Remotion接入自研视频编辑器,AI可编辑特效 — mattpocockuk · 2026-08-23
- 过度依赖系统提示词做 LLM 安全防护很危险 — Loud-Ad-5852 · 2026-08-23