4GB 显存跑本地模型,除了 llama.cpp 还有更快的选择吗?

your_real_Fathe_ · reddit · 2026-10-10

一位在 4GB 显存 RTX 上跑本地模型的用户发帖求助:他在用 llama.cpp,想找到资源利用更高效、tokens/sec 更高的替代方案,且不想背上 PyTorch 等重型依赖。

他表示调研后一无所获:大多数选项基于 Python 和 PyTorch,模型还没加载显存就被吃光;有的面向未量化模型、有的基于两年前的老模型、有的目标设备完全不匹配(如 MNN)、还有的只是论文没有实现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →