回顾本地跑 Bloom 的年代
ilarp · reddit · 2026-07-11
作者回顾早期跑 Bloom 的体验:为了本地推理,曾购买 768GB Optane 硬盘并依赖 swap,生成一个 token 甚至要等约 20 分钟。
帖子想表达的是本地大模型推理能力这几年进步巨大,今天再回头体验早期模型,会更直观感受到本地部署环境和推理效率的变化。
「Infra」频道最新
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11
- p99 延迟基准可能在骗你:一篇长文讲透 coordinated omission — Franc0Fernand0 · 2026-09-11
- 12GB 显卡跑 MiniMax H3:量化格式、加速 LoRA 与注意力方案怎么选 — Possible_Mood676 · 2026-09-11
- Spomin:在 KV cache 里实时压缩上下文,500k 源 token 压进 180k 驻留 — wgaca2 · 2026-09-11