硬核实测:双集群跨机跑 Kimi K3 本地推理

segmond · reddit · 2026-08-09

Reddit 网友分享了自己在本地运行 Kimi K3 模型的硬核实践。由于单机显存不足以完全加载模型,作者利用 llama.cpp 通过 RPC 协议跨两个计算集群进行分布式推理,主集群仍需部分卸载到内存运行。

作者目前运行的是 IQ1M 量化版本,目标是未来升级到 Q2KXL。他计划将所有 GPU 集中到单一系统中以取消 RPC 延迟,预计速度可提升 2-3 倍。在使用策略上,他打算用大模型进行任务规划,再将具体编码工作分发给 DeepSeek 和 Qwen 等更小更快的模型执行,展现了硬核极客的本地算力极限压榨与智能体调度思路。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →