llama.cpp 新增成本加权张量拆分:混合多卡推理提速 3-4%

milpster · reddit · 2026-08-11

开发者为 llama.cpp 引入了一种基于成本加权的新张量拆分模式(-sm cost),在特定的多卡混合配置下显著提升了推理速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →