DeepSeek-V4.1-Flash 跨 M5 Ultra 与双 RTX PRO 6000 分层运行

harrythunder · reddit · 2026-09-26

作者分享一个本地部署技巧:DeepSeek-V4.1-Flash 的 prompt 状态每 token 仅 0.9 KB,因此可以在第 20 层把模型切开,跨 CUDA(2× RTX PRO 6000)和 Metal(M5 Ultra)两端运行,只需 1/10GbE 网络连接即可。附详细教程链接,对想用混合 Mac+PC 硬件跑大模型的本地部署玩家有直接参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →