同一模型普通聊天 27t/s,挂上 Agent 框架只剩 15t/s
WizardlyBump17 · reddit · 2026-08-23
用户在本地用 llama.cpp(Intel B580 GPU + 7 5700X3D + 48GB 内存)跑 Qwen3.6 35B A3B,普通对话约 27 tok/s,但接入 OpenCode、Maki 等编码 agent 框架后掉到 15 tok/s,且上下文远比普通聊天短。帖内附完整 Docker 启动参数(262K 上下文、Q80 KV cache、MTP 投机解码等),求助框架为何拖慢推理。
「编程与Agent」频道最新
- 构建优秀评测:拒绝单一分数与盲目爬坡 — realmadhuguru · 2026-08-23
- 反对过度抽取函数:好的代码应减少跳转层级 — serrjoa · 2026-08-23
- 谷歌 Antigravity 走热,开发者盛赞搭配 3.7 Flash 开发体验 — jocarrasqueira · 2026-08-23
- 研究揭示 Agent 自我改进易陷入局部最优 — omarsar0 · 2026-08-23
- 首个统一 Agent Harness 接口开源,Apache 2.0 协议 — jasonkneen · 2026-08-23
- Qwen3.6 上 AMD 核显跑 449t/s,65k 上下文是真极限 — jstormes · 2026-08-23