本地跑 AI 只需搞懂 4 件事:模型、Hugging Face、运行器与量化
Roger_M_Taylor · x · 2026-09-09
一篇本地 AI 入门科普,把本地部署拆成 4 个概念:
- 模型是大脑文件:Gemma、Llama、Mistral、Qwen、Phi 等
- 仓库:去 Hugging Face 找模型
- 运行软件:初次尝试用 LM Studio,做应用用 Ollama
- 工作流:由前三者组合出的成品
硬件与量化要点:
- 2B–4B 模型适合手机/小任务,12B 居中,26B–31B 需工作站
- Q4 量化更好跑,Q8 保留更多质量但吃内存;Q4 稍损质量却省下约 5000 美元的工作站
- 建议从 2021 年的旧笔记本开始,先在 Hugging Face 慢慢读一张模型卡
「Infra」频道最新
- 曝 OpenAI 算力吃紧,GPT-6 增长或致暂停新增 Pro 订阅 — op7418 · 2026-09-09
- 一个 flag 就能用 vLLM 服务任意 Transformers 模型,无需手写移植 — ariG23498 · 2026-09-09
- OpenAI 高管称 Astra 需求空前,GPT-6 用量若续涨或暂停新增 Pro 订阅 — op7418 · 2026-09-09
- BeaconKV:用信标查询预测 KV 缓存复用,压缩长推理链显存 — Janghyeon Kim · 2026-09-09
- Google 称 AI 服务器回本周期不到两年,自研芯片仅一年 — SumitGup · 2026-09-09
- Together 称 GLM-5.3 Flash 跑分超 Claude Fable 5.1,成本仅约 1% — togethercompute · 2026-09-09