128GB M5 Max 跑 Qwen 27B 长上下文太慢,5090 32GB 够用吗
lots_of_puppies · reddit · 2026-09-25
Reddit 用户已有 128GB 的 M5 Max,本地跑 Qwen 27B 尚可,但随上下文增长 prompt 处理和输出速度明显下降;Qwen Next 更快但仍难以支撑大量 agentic 编码工作。他在考虑换装 RTX 5090(64GB DDR5、9950X3D)的游戏主机,预计 prompt 处理可达 3000+、输出 80-150 tok/s。核心顾虑:5090 只有 32GB 显存,Q8 量化加 256k 上下文根本放不下,可能只能降到 Q4 且装不下完整 262k 上下文,发帖征求是否值得入手。
「Infra」频道最新
- Meta 发布 Muse Realtime Avatars,实时视频生成推理栈成核心难点 — ukhndlwl · 2026-09-25
- 高盛大幅上调 AI 算力预测:2030 全球数据中心容量升至 217GW — McDonaghMatthew · 2026-09-25
- 4400 美元在 RTX 5090 上预训练出媲美 Qwen2-1.5B 的开源 2B 模型 — IgorCarron · 2026-09-25
- YC 系 Prism 推出开源 LLM 推理云,DeepSeek V4.1 Flash 达 547 tok/s — ycombinator · 2026-09-25
- 押注未来三年:他自建本地推理栈,双 5060 Ti 跑出 100 tok/s — No-Name-Person111 · 2026-09-25
- 谷歌 Suncatcher 计划:太阳能供能的太空 AI 数据中心 — The Decoder · 2026-09-25