自托管管线的硬件拆分方案

TheZachMueller · x · 2026-07-11

作者补充说,他的自托管方案是把 **Kimi** 和 **GLM** 分别跑在一台 **B200** 节点的一半资源上,使用的是 **NVFP4**;其中 Kimi 还带了一个 speculative decoder。 他还提到自己在等 kernel 相关实验跑完,再把 **Flash** 也加进去并在本地托管。

所属事件:作者将编码流程迁至自托管 GLM(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →