2×4090 本地跑 Agent 实测:软上限 5 个@64k,硬上限 9 个
Iamisseibelial · reddit · 2026-09-09
一位非营利组织 CTO 用三周时间系统测试 2×RTX 4090(44.6 GiB 可用显存、Threadripper、128 GB DDR5)上 llama.cpp 的多 agent 并发能力,结论:软上限 5 个并发@64k 上下文,硬上限 9 个。
模型选型教训
- Qwen3.5-122B-A10B(UD-IQ4XS)解码 18.75 tok/s,但每次 agent 工具调用要 11.91 秒,27B 只要 3.40 秒——对动辄几十次调用的 agent,单次延迟才是关键。
- Qwen3.6-35B-A3B 解码最快(78 tok/s),但 5 个执行任务挂 1 个(滑动窗口 bug),27B 全过——证明「解码 tok/s」不是正确指标。
- Qwen3.8-Flash-Next(125B MoE)全调优后仅 23.7 tok/s:103.7 GiB 权重中 71.7 GiB 是路由专家,大部分驻留系统内存、每 token 走内存总线,而其 4 内存通道只插了 2 条,实测有效带宽仅 14.1 GB/s(峰值 83.2)——补齐通道比任何调参都值,但内存太贵只好放弃。
量化精度:自建长文档探针(在 15%/50%/85% 深度埋点、配 6 条诱饵行),24 种配置下 Q4KM、Q6KXL、Q8KXL 全部召回 1.00,无跨槽泄漏,最大正确回答 prompt 达 251,557 token——量化选择对这种 agent 任务几乎无差别。
「Infra」频道最新
- Meta post-Watermelon 训练爆料更新:扎克伯格原话视频上线 — rohanpaul_ai · 2026-09-09
- 扎克伯格:Meta 已开始训练 Watermelon 之后的更大模型 — rohanpaul_ai · 2026-09-09
- 智能卸载活跃请求 KV cache,线性注意力内存优势不再 — samsja19 · 2026-09-09
- 骁龙 8 Gen 3 手机端离线生成视频,一段约 10 分钟 — sgcego · 2026-09-09
- 就算 OpenAI 倒闭也挡不住 AI 建设:GPU 只会换手加速扩张 — markjeffrey · 2026-09-09
- 2x RTX 2060 跑 Qwen3.8 27B 达 45 tok/s,值得换 AMD 6800 双卡吗 — BarberIcy366 · 2026-09-09