前 SWE 转推理工程师:Ollama 从不最优,运行时与量化避坑指南
Postmodern_Plunger · reddit · 2026-10-02
一位从软件工程师转做推理工程的作者,因需求旺盛把副业转成全职,并总结了社区里常见的推理配置错误。
运行时选择:
- Ollama 从不最优,只是最简单,适合快速上手且内存充裕的场景,但速度不是最好
- 需要 CPU offload 时选 llama.cpp;纯 GPU 场景 VLLM 通常最好
- 工作流涉及 Langgraph 可考虑 SGLang,否则用上面两个即可覆盖 90% 情况
- 用主线分支,社区 fork 只针对特定模型/配置,通常欠优化且维护差
运行时优化:
- 必须用硬件特定编译标志编译,最常被漏掉的是架构特定优化
- 系统更新、内核/驱动更新、运行比上次编译更新的模型、或超过一个月未重编译时,都应重新编译
量化:
- IQ 量化通常同体积最优,IQ4XS 比 Q4KM 显存更小且复杂度更高
- 非线性(NL)量化只在有 CPU offload 时更好,且 IQ 常提供更多上下文空间
- 遇到没见过的量化先读文档,搜索或问 ChatGPT 对自定义量化「每次都会给错答案」
- 无硬件约束时标准 QKM 量化路径优化最好,但那时不如换更强的模型
任务选型:作者认为编码任务 API 首选 Anthropic,Opus 和 Sonnet 5.5 性能强且每任务 token 消耗低,比前代更便宜;文中还提到 DeepSeek(原文在此截断)。
「Infra」频道最新
- Cloudflare 推出 SQL API:Workers 日志与追踪可直接用 SQL 查询 — irvinebroque · 2026-10-02
- Cloudflare 推出 AI Gateway Web Search API,统一接入三家搜索商 — michellechen · 2026-10-02
- Zig 从零写的机器浏览器 Lightpanda 1.0 正式发布 — jedisct1 · 2026-10-02
- 24GB 显卡塞下 Qwen3.8-27B 编码模型:262k 上下文仍有 40 t/s — W61k3r · 2026-10-02
- Suffix Cache Reuse:为 Agent 设计的 KV 缓存复用新方案 — RulinShao · 2026-10-02
- NVIDIA DGX Spark 新款砍半至 64GB 内存,售价却与 128GB 版相近 — firstadopter · 2026-10-02