开权重模型正在赢在“普通人买得起的硬件”上
max_paperclips · x · 2026-07-24
这条转发的核心观点是:开权重模型的胜负,不在于谁能堆到数据中心级别,而在于谁能真正跑在用户买得起的硬件上。
被引内容给出了一个很具体的本地部署分层清单:
- 8–12GB 显存:推荐 Bonsai 27B,作者称它是把 Qwen 3.6 27B 压到 1bit 后仍能跑完整 agent loop、128k 上下文。
- 24GB RTX 3090:推荐 Qwen 3.6 27B dense Q4,主打更好的原始质量。
- 128GB DGX Spark:推荐 Poolside 的 Laguna-S 2.1 NVFP4,称其为 118B MoE,能在单机上跑到 30–45 tok/s、维持 128k 窗口。
原帖还提到,NVIDIA 过去一年在“资助建设者、押注开源生态、把真实模型端上桌”上动作明显,Nemotron 和 Nano 3 被视为这种策略的代表。
「Infra」频道最新
- DeepSeek 算力集群可靠性岗位,折射出组织快速拆分 — teortaxesTex · 2026-07-24
- Fable 5 疑似接入 API 与 Slack 做工作流自动化 — beechinour · 2026-07-24
- 本地 LLM 推理的可用基线是 8-bit KV cache 加 4-bit 权重 — max_paperclips · 2026-07-24
- AI 恐慌简报把 Kimi K-3 争议与算力瓶颈串联起来 — The AI Daily Brief · 2026-07-24
- MiniMax 称 AMD MI355X 在模型 serving 上已接近 B200 — hongyangzh · 2026-07-24
- Alphabet 营收增 24%至 1198 亿美元,云业务增 82% — minsuk_chang · 2026-07-24