用 MLP 上下文强盗实现 LLM 能源节流
hongyangzh · x · 2026-09-02
作者探索了“能源节流 LLM”的方法,旨在解决在使用 SGLang 运行 EAGLE-3 推测解码时参数选择困难的问题。
核心方法:
- 跟踪真实运行的 trace 数据。
- 将每个配置视为一个动作。
- 在此基础上训练一个微小的 MLP 上下文强盗模型。
效果: 即使是结合旧 RL 思想的小模型,也能根据 GPU 实际可维持的能耗动态选择 EAGLE-3 参数,而非盲目推测。
「Infra」频道最新
- 推测解码:利用拒绝采样加速LLM推理的技巧 — jbhuang0604 · 2026-09-02
- 播客:为何租不到 GPU,推理算法过时,HF 黑客事件分析 — ziv_ravid · 2026-09-02
- Google Cloud Run 集成 Gemini Agent Platform,赋予身份与注册能力 — steren · 2026-09-02
- 27.5% 资本支出用于电力制冷,算力成本分析 — NaveenGRao · 2026-09-02
- AI扩产带火小金属:中国垄断铒与钇的供应链优势 — 量子位 · 2026-09-02
- FORGE 框架发布:定义 AI 数据中心十大安全风险 — AccBalanced · 2026-09-02