自托管管线的硬件拆分方案

TheZachMueller · x · 2026-07-11

作者补充说,他的自托管方案是把 Kimi 和 GLM 分别跑在一台 B200 节点的一半资源上,使用的是 NVFP4;其中 Kimi 还带了一个 speculative decoder。

他还提到自己在等 kernel 相关实验跑完,再把 Flash 也加进去并在本地托管。

所属事件:作者将编码流程迁至自托管 GLM(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →