ktransformers支持24G显存本地运行超大模型

清华大学团队推出灵活的异构大模型推理与微调优化框架ktransformers,引发广泛关注。该框架通过CPU-GPU异构计算优化MoE模型部署,将常用experts保留在GPU上,其余部分卸载至CPU,从而大幅降低显存门槛。这使得普通用户仅需24GB显存即可在本地流畅运行Kimi等参数量巨大的模型。

2026-07-18 ~ 2026-07-19 · 4 条相关