零月租跑70B大模型:双卡3090本地部署Qwen 2.5全教程
thisdudelikesAI · x · 2026-08-08
作者分享了如何零月租在本地运行 70B 参数大模型(Qwen 2.5 72B)的完整 5 步指南,彻底告别 API 费用、速率限制和隐私担忧。
核心硬件与成本
- 推荐配置:双 RTX 3090/4090(48GB VRAM)、单 24GB 显卡+64GB 内存,或 64GB+ 统一内存的 M 系列Mac。
- 二手双 3090 主机约 1400-1800 美元,对比每月 200-500 美元的 GPT-4 API 费用,不到半年即可回本。
部署步骤
- 安装 Ollama:它负责运行时、量化与 GPU 卸载,无需手动配置底层参数。
- 拉取模型:使用 ollama pull qwen2.5:72b,推荐默认的 Q4KM 量化版(约 43GB),兼顾质量与体积。
- 加载运行:双卡预计 15-20 tokens/s,单卡+CPU 卸载约 5-10 tokens/s,Mac 统一内存约 8-12 tokens/s。
- 添加 UI:通过 Docker 部署 Open WebUI,获得类 ChatGPT 的本地界面。
部署后可享受 128K 上下文、完整工具调用且数据完全离线自控。
「编程与Agent」频道最新
- TensorLens:纯浏览器端检查 HF 模型量化分布的开源工具 — Brilliant-Hall1387 · 2026-08-08
- 让 Claude 游玩《毁灭战士》,并用 W&B 记录每帧决策 — _ScottCondron · 2026-08-08
- 开发者实测:日常编码中最实用的 AI Agent 技能盘点 — jonathan_wilke · 2026-08-08
- 阿里开源 Page Agent:纯 JS 注入网页的 GUI 智能体 — thisguyknowsai · 2026-08-08
- AI对齐已非最大难题,无护栏智能体引安全担忧 — teortaxesTex · 2026-08-08
- Vercel 开源知识库 Agent 模板:抛弃向量库改用 grep — tom_doerr · 2026-08-08