ktransformers支持24G显存本地运行超大模型
清华大学团队推出灵活的异构大模型推理与微调优化框架ktransformers,引发广泛关注。该框架通过CPU-GPU异构计算优化MoE模型部署,将常用experts保留在GPU上,其余部分卸载至CPU,从而大幅降低显存门槛。这使得普通用户仅需24GB显存即可在本地流畅运行Kimi等参数量巨大的模型。
2026-07-18 ~ 2026-07-19 · 4 条相关
- ktransformers:24GB显存跑大模型 — dosco · 2026-07-18
- ktransformers 让巨模可本地跑 — alex_verem · 2026-07-18
- KTransformers:大模型推理微调框架 — thesupermanmx · 2026-07-19
- 异构 LLM 优化框架 ktransformers — kvcache-ai · 2026-07-19