EnerTune 登 SOSP'26:推理能耗较 SOTA 降低 1.4–2.3 倍
tianyin_xu · x · 2026-09-30
EnerTune 将在 SOSP '26 上发表。该系统在满足性能目标的前提下直接以能耗为优化目标进行调优,相比 SOTA 推理服务系统降低能耗 1.4–2.3 倍,是面向 LLM 推理基础设施的能效优化工作。
「Infra」频道最新
- 不换模型也能省 AI 账单:五招优化 LLM 使用成本 — goyalshaliniuk · 2026-09-30
- DeepSeek 转用华为昇腾 950 训练模型 — WebAssemblyMan · 2026-09-30
- FreeToken 开源:消费级硬件本地跑 290B+ MoE 模型 — tom_doerr · 2026-09-30
- SOSP'26 论文:面向能耗的 GPU 共享方案,重思推理服务利用率 — tianyin_xu · 2026-09-30
- SOSP'26 两篇系统论文:AI Agent 隔离数据流与 CXL 共享内存索引 — tianyin_xu · 2026-09-30
- DeepSeek 开源华为昇腾工具包, TileLang 支持瞄准 CUDA 替代 — kimmonismus · 2026-09-30