开权重模型正在赢在“普通人买得起的硬件”上
max_paperclips · x · 2026-07-24
这条转发的核心观点是:开权重模型的胜负,不在于谁能堆到数据中心级别,而在于谁能真正跑在用户买得起的硬件上。
被引内容给出了一个很具体的本地部署分层清单:
- 8–12GB 显存:推荐 Bonsai 27B,作者称它是把 Qwen 3.6 27B 压到 1bit 后仍能跑完整 agent loop、128k 上下文。
- 24GB RTX 3090:推荐 Qwen 3.6 27B dense Q4,主打更好的原始质量。
- 128GB DGX Spark:推荐 Poolside 的 Laguna-S 2.1 NVFP4,称其为 118B MoE,能在单机上跑到 30–45 tok/s、维持 128k 窗口。
原帖还提到,NVIDIA 过去一年在“资助建设者、押注开源生态、把真实模型端上桌”上动作明显,Nemotron 和 Nano 3 被视为这种策略的代表。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11