花 1.8 万欧自建 768GB 显存服务器,却追不上 2 万亿参数开源模型
myreala · reddit · 2026-09-04
一位 Reddit 用户花约 1.8 万欧元组装了一台 EPYC 服务器:12 张 64GB 显存卡(共 768GB VRAM)加 256GB 内存,目标是本地跑前沿开源大模型。但他发现可能「已经过时」:新一代开源前沿模型普遍走向 2 万亿参数以上。
在他看来,目前只有 GLM 5.3 还能勉强跑,而 Astra 发布后它会明显落后;下一代 GLM 6 规模可能是现在的两到三倍,Qwen-max、Kimi 以及 DeepSeek V4 Pro 都大到无法考虑。
他在纠结是否放弃「前沿梦」:卖掉多余 GPU,换用少量卡跑 flash 小模型。他原本希望借此创业,但也承认同样的业务用 flash 模型加上更多工程努力大概也能做。这是个人级算力投入在模型快速膨胀时代的一个典型两难案例。
「Infra」频道最新
- Spotify 工程团队用 Portal 路由策略,砍掉 90% Claude Code token — rseroter · 2026-09-04
- 开源桌面工作台 Vyact:本地模型+文档 RAG+浏览器上下文一站集成 — vyact · 2026-09-04
- KV 量化在多深上下文开始劣化?F16 vs Q8/Q4 序列对齐 PoC — Slight_Analysis_5414 · 2026-09-04
- KV 缓存:自回归 LLM 推理的根基性优化,用内存换算力 — alec_helbling · 2026-09-04
- WSJ:数据中心让路易斯安那小县居民「集体中彩票」 — robleclerc · 2026-09-04
- 无编排器无 MCP:4 个对等 Agent 通过 gossip 组网完成真实调研任务 — Trainer_Intelligent · 2026-09-04