5种LLM量化技术详解:如何在单GPU运行70B模型
Roger_M_Taylor · x · 2026-07-24
介绍5种LLM量化技术:RTN、GPTQ、AWQ等,解释如何将70B模型从140GB压缩至35GB,并处理异常值问题。
「Infra」频道最新
- Qwen 3.6 35B MoE 在 12GB 内存的小米 12 Pro 上跑到 2.4 tok/s — Aromatic_Ad_7557 · 2026-07-24
- Baseten 推出 GLM-5.2 Fast API,吞吐提升 2 到 3 倍 — baseten · 2026-07-24
- Intel 称数据中心供给紧到四季度,营收达 161 亿美元超预期 — BenBajarin · 2026-07-24
- Baseten 推出 GLM-5.2 Fast,实时场景 TPS 提升 2-3 倍 — baseten · 2026-07-24
- Anthropic 似乎在转录中用 Deepgram,但未列入子处理方 — tokenbender · 2026-07-24
- 英特尔财报超预期股价大涨 11%,AI 需求成关键动力 — econoar · 2026-07-24