砍掉 50ms 层间延迟:开发者实调 GPU+CPU 混合推理的热专家映射

HankYeomans · x · 2026-10-12

开发者分享其「Frankenstein」本地 LLM 推理栈的调优进展:早期版本中 nvtop 图表显示每层存在大量 30-40ms 的空闲切片,日志显示每 chunk 出现约 80 次。

通过把每层 chunk 的初始 90ms 开销削减 50ms,并实现可用的 hot-expert 映射(GPU↔CPU/RAM),这些空闲切片现在基本消失,每层延迟降到仅几毫秒。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →