Colibrì 引擎升级:支持 2.8T 参数模型,显存吞吐暴增
solyarisoftware · x · 2026-08-27
Colibrì 引擎发布重大更新,将整台机器视为统一的 AI 内存层级:VRAM 存储热点专家、内存存储温热专家、NVMe SSD 存储其余数据。它现已支持 Qwen3.6、DeepSeek V4 Flash、GLM-5.2 以及 Kimi K3 (2.8T 参数) 等模型。新增功能包括 GPU 专家缓存、预取、双 NVMe 条带化,并支持 CUDA、ROCm、Metal、Vulkan 及分布式专家 Worker。测试显示,启用专家缓存后,Qwen3.6-35B-A3B 在双 8GB 显卡上的生成速度从 1.44 tok/s 提升至 10.05 tok/s。
「Infra」频道最新
- 为何目前没有完全免费开源的 AI 网关? — tristanbob · 2026-08-27
- AWS 拟于 2027-28 部署 200 万张英伟达新 GPU — BenBajarin · 2026-08-27
- 客户为性能宁愿放弃部分 AI 成本节省 — aronchick · 2026-08-27
- Zai 集群算力提升 3 倍,端到端性能媲美英伟达 GPU — pstAsiatech · 2026-08-27
- 观点:云算力服务被利用,问题或源于时间限制而非 Agent 本身 — dfrsrchtwts · 2026-08-27
- 预测:单台桌面机将能运行 k3 级模型 — AaronBergman18 · 2026-08-27