开源 QuantProbe 预测老电脑本地 LLM 速度
Ok_Brush_3449 · reddit · 2026-07-23
QuantProbe 是一个开源项目,用来为本地 LLM 选择量化和内存分配方案,尽量在个人机器上跑得更稳、更快。
作者给出的实测很有代表性:在一台 2016 年的电脑上,16GB 内存加 SATA 硬盘运行 110B 模型,预测速度是 0.2–0.3 tok/s,实际测得 0.19 tok/s;而同一套规律在 GTX 1060 6GB 上跑 30B 模型时,速度可达 19.3 tok/s。项目目标是让本地模型的性能更可预测,也更容易被普通机器承载。
作者在招测试者和贡献者,并认为这套方法可能成为后续“token economy”和本地推理权衡研究的起点。
「Infra」频道最新
- AMD 为 Anthropic 锁定 2GW MI450 GPU,并拟投资最高 50 亿美元 — Beth_Kindig · 2026-07-23
- Signal65 评测称 MI355X 推理性价比最高可达 B200 的 2.15 倍 — ryanshrout · 2026-07-23
- AI 岗位提到 evals 的占比升至 10.7% — HamelHusain · 2026-07-23
- Writer 研究揭示:优化 AI 外部架构可降本 41% 且不损精度 — bendee983 · 2026-07-23
- 语音助手把后端迁到欧洲后,工具调用立刻变快 — ur_piyo_a_hoe · 2026-07-23
- Meta 重构 BLOB 存储,缓解 exabyte 级集群 GPU 空转 — Meta_Engineers · 2026-07-23