开源 LayerLens:按 token×层粒度剖析 LLM 推理耗时

Dry_Mixture130 · reddit · 2026-09-11

开发者发布开源工具 LayerLens(GitHub: coconinja2/layerlens),一个 LLM 推理 profiler,可将推理耗时分解为 token × transformer 层的计时视图,能区分 prefill 与 decode 并可视化每层耗时。作者计划加入 KV-cache 事件、调度/批处理状态、请求 ID、GPU kernel 关联、投机解码等,并征求推理系统从业者的反馈:这个抽象层次是否真的有用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →