开源 QuantProbe 预测老电脑本地 LLM 速度

Ok_Brush_3449 · reddit · 2026-07-23

QuantProbe 是一个开源项目,用来为本地 LLM 选择量化和内存分配方案,尽量在个人机器上跑得更稳、更快。

作者给出的实测很有代表性:在一台 2016 年的电脑上,16GB 内存加 SATA 硬盘运行 110B 模型,预测速度是 0.2–0.3 tok/s,实际测得 0.19 tok/s;而同一套规律在 GTX 1060 6GB 上跑 30B 模型时,速度可达 19.3 tok/s。项目目标是让本地模型的性能更可预测,也更容易被普通机器承载。

作者在招测试者和贡献者,并认为这套方法可能成为后续“token economy”和本地推理权衡研究的起点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →