GPU 跑大模型之余用闲置 CPU 带小模型子代理,Reddit 玩家晒实测数据

Thin_Pollution8843 · reddit · 2026-09-15

Reddit 用户提出一种本地推理的资源拆分思路:GPU 上跑主力模型(如 Qwen3 8B)时,把几乎闲置的内存和 CPU 用来运行一批小尺寸模型的「子代理舰队」,让它们承担搜索、小块代码编写或执行杂务等轻任务,以节省 KV cache 和算力。

他举例可用 LFM2.5-2.6B 或 Spark-X2.5-4B 这类小模型,并给出实测:LFM2.5-2.6B 在 EPYC 7452 上并发 4 路时合计约 200 pp(prompt processing)和 80 tg(token generation)。帖子征集其他人的混合部署方案,以及小模型在哪些场景有价值、哪些场景完全无用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →