DeepSeek-V4.1-Flash 跨 M5 Ultra 与双 RTX PRO 6000 分层运行
harrythunder · reddit · 2026-09-26
作者分享一个本地部署技巧:DeepSeek-V4.1-Flash 的 prompt 状态每 token 仅 0.9 KB,因此可以在第 20 层把模型切开,跨 CUDA(2× RTX PRO 6000)和 Metal(M5 Ultra)两端运行,只需 1/10GbE 网络连接即可。附详细教程链接,对想用混合 Mac+PC 硬件跑大模型的本地部署玩家有直接参考价值。
「Infra」频道最新
- Google DeepMind 免费放出 LLM 扩展教程《How to Scale Your Model》并新增 GPU 章节 — mdancho84 · 2026-09-26
- 谷歌 150 亿美元印度数据中心项目遭村民抗议,土地承诺落空 — nordicinst · 2026-09-26
- Nvidia SoL-Pi 优化 agent 控制层,编码 token 用量最多省 49% — The Decoder · 2026-09-26
- 6 张 3090 跑 Qwen3.8 本地部署实测:80-120 tokens/s — takoulseum · 2026-09-26
- Gemma 4 31B Q8 突然在 68k 上下文报显存共享超限错误 — Few_Professional6859 · 2026-09-26
- Meta 开源 30B 本地智能体模型 Muse Glimmer,17GB 量化跑进 24GB 单卡 — bibryam · 2026-09-26