砍掉 50ms 层间延迟:开发者实调 GPU+CPU 混合推理的热专家映射
HankYeomans · x · 2026-10-12
开发者分享其「Frankenstein」本地 LLM 推理栈的调优进展:早期版本中 nvtop 图表显示每层存在大量 30-40ms 的空闲切片,日志显示每 chunk 出现约 80 次。
通过把每层 chunk 的初始 90ms 开销削减 50ms,并实现可用的 hot-expert 映射(GPU↔CPU/RAM),这些空闲切片现在基本消失,每层延迟降到仅几毫秒。
「Infra」频道最新
- 算力都砸在能力上没人做「常驻」?创业者提出 Agent 杠杆三因子 — nbaschez · 2026-10-12
- 分析师:自建开源模型是英伟达的博弈论最优解,封闭模型反成生存威胁 — Rewkang · 2026-10-12
- 双卡昇腾 310P 跑通 GLM-5.3-Flash:8 tok/s、31 万上下文实录 — matteiuspi · 2026-10-12
- SemiAnalysis 估算 Anthropic 订阅用户每美元算力约为 API 用户的 4 倍以上 — rohanpaul_ai · 2026-10-12
- 数据中心停产禁令蔓延,AI 业界靠废除 NDA 能否扭转口碑 — TechCrunch AI · 2026-10-12
- GPU 实测吞吐表新增 B300/MI355X 等,B200 实际仅达理论值 77% — StasBekman · 2026-10-12