开源 LayerLens:按 token×层粒度剖析 LLM 推理耗时
Dry_Mixture130 · reddit · 2026-09-11
开发者发布开源工具 LayerLens(GitHub: coconinja2/layerlens),一个 LLM 推理 profiler,可将推理耗时分解为 token × transformer 层的计时视图,能区分 prefill 与 decode 并可视化每层耗时。作者计划加入 KV-cache 事件、调度/批处理状态、请求 ID、GPU kernel 关联、投机解码等,并征求推理系统从业者的反馈:这个抽象层次是否真的有用。
「Infra」频道最新
- Bartowski 发文解析 GGUF 量化新方案:按张量布局映射分配位宽 — bartowski1182 · 2026-09-11
- antirez 在 128GB M5 Max 上跑 DeepSeek v4.1 Flash,SSD 流式加载快得出乎意料 — antirez · 2026-09-11
- 分析称 OpenAI 仍有约 7 倍训练算力余量,开源差距只是暂未拉开 — soumitrashukla9 · 2026-09-11
- DeepSeek 发布 V4.1-Flash,同周曝 Nvidia 200 亿美元 Groq 交易遭 DOJ 审查 — eyishazyer · 2026-09-11
- Persimmon 训练细节:基于 NVIDIA 550B Nemotron,数千块 Blackwell GPU — niloofar_mire · 2026-09-11
- NVIDIA 详解 EPD 分离架构:多模态推理首字延迟最高提速 5 倍 — NVIDIAAI · 2026-09-11