多卡集群本地并发跑满多款开源大模型,性能数据曝光
Any-Lingonberry7411 · reddit · 2026-08-07
一位开发者展示了其用于智能体编程(Agentic Coding)的豪华多卡本地集群,并分享了并发运行多个开源大模型的实测性能。
- 硬件配置:主机搭载 RTX 6000 Pro Blackwell (96GB) + 2x RTX 5090 + 1x RTX 4090 + 3x AMD R9700,辅以 96GB 内存;另配备 Strix Halo 笔记本与 RTX 3090 主机作为辅助。
- 并发表现:可在主机同时运行 DeepSeek-V4-Flash (45 t/s)、GLM-4.7-flash (20 t/s)、Gemma-4-12B (25 t/s) 等多个模型。若集中算力,可跑起 GLM-5.2 或 Kimi-K2.7-Code。
- 当前痛点:作者表示目前很难在“快速执行者”与“深度思考者”之间无缝切换,频繁换模型导致显存驱逐与缓存失效,严重拖慢效率,正在寻求升级建议。
「编程与Agent」频道最新
- 实测AI编程工具指令文件:臃肿文档致Token浪费83% — RunAI_Coder · 2026-08-07
- UltraContext:开源 AI 智能体实时上下文共享基础设施 — tom_doerr · 2026-08-07
- 开发者发布Corigin ChatGPT移动SSH网关,提供持久化沙箱 — mattrickard · 2026-08-07
- 8个Claude高级提示词:从零构建完整移动应用 — nikola_mr64990 · 2026-08-07
- Rust 开源工具 Litho:一键将源码转为 C4 架构文档 — tom_doerr · 2026-08-07
- 用Python构建工具调用Agent:调试实战指南 — OnlineInference · 2026-08-07