2×4090 本地跑 Agent 实测:软上限 5 个@64k,硬上限 9 个

Iamisseibelial · reddit · 2026-09-09

一位非营利组织 CTO 用三周时间系统测试 2×RTX 4090(44.6 GiB 可用显存、Threadripper、128 GB DDR5)上 llama.cpp 的多 agent 并发能力,结论:软上限 5 个并发@64k 上下文,硬上限 9 个。

模型选型教训

量化精度:自建长文档探针(在 15%/50%/85% 深度埋点、配 6 条诱饵行),24 种配置下 Q4KM、Q6KXL、Q8KXL 全部召回 1.00,无跨槽泄漏,最大正确回答 prompt 达 251,557 token——量化选择对这种 agent 任务几乎无差别。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →