llm-tune 开源:一键为本地 LLM 找最优量化与推理参数
Distinct-Pie2389 · reddit · 2026-10-09
开发者开源了 llm-tune 工具,帮你在自己的硬件上找到本地 LLM 的最佳运行配置。特性:
- 架构支持:Dense、MoE、混合 MoE/Mamba;
- 硬件支持:NVIDIA、AMD、Intel Arc GPU,Apple Silicon 走 MLX;
- 推理引擎:llama.cpp、Ollama、vLLM;
- 可调项:量化、上下文/KV cache、GPU offload、MTP、采样、推理模式与 agent harness 设置;
- 基准输出:显存/内存占用、tokens/sec、上下文召回率与输出质量。
目前主要在 RTX 4090 上实测,其他硬件与后端已文档化但待更多真实环境验证,作者征集反馈与测试数据。
「Infra」频道最新
- OpenAI 收入口径引抛售:SOX 跌 3.4%,TSMC 9 月营收却逆势涨 55% — tengyanAI · 2026-10-09
- 40G 显存训练 Qwen3.8-Flash-Next:LoRA over GGUF 无需 CPU offload — woct0rdho · 2026-10-09
- Nunchux 推理引擎入驻 AMD AI 推理生态,优化 Instinct GPU 多模态推理 — junyanz89 · 2026-10-09
- tinygrad 用 4 台自研 tinybox 承载 GitHub Actions CI — AIFlow_ML · 2026-10-09
- OpenAI 万级并发 Agent 耗 1300 亿 token,slime v0.4.0 应对 RL 扩展 — teortaxesTex · 2026-10-09
- TokenRouter 实现 token 级 LLM 路由服务,解码吞吐提升最高 64 倍 — nics-efc · 2026-10-09