Colibrì 引擎升级:支持 2.8T 参数模型,显存吞吐暴增

solyarisoftware · x · 2026-08-27

Colibrì 引擎发布重大更新,将整台机器视为统一的 AI 内存层级:VRAM 存储热点专家、内存存储温热专家、NVMe SSD 存储其余数据。它现已支持 Qwen3.6、DeepSeek V4 Flash、GLM-5.2 以及 Kimi K3 (2.8T 参数) 等模型。新增功能包括 GPU 专家缓存、预取、双 NVMe 条带化,并支持 CUDA、ROCm、Metal、Vulkan 及分布式专家 Worker。测试显示,启用专家缓存后,Qwen3.6-35B-A3B 在双 8GB 显卡上的生成速度从 1.44 tok/s 提升至 10.05 tok/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →