同一模型普通聊天 27t/s,挂上 Agent 框架只剩 15t/s

WizardlyBump17 · reddit · 2026-08-23

用户在本地用 llama.cpp(Intel B580 GPU + 7 5700X3D + 48GB 内存)跑 Qwen3.6 35B A3B,普通对话约 27 tok/s,但接入 OpenCode、Maki 等编码 agent 框架后掉到 15 tok/s,且上下文远比普通聊天短。帖内附完整 Docker 启动参数(262K 上下文、Q80 KV cache、MTP 投机解码等),求助框架为何拖慢推理。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →