数据库老兵押注负载感知推理:批处理 LLM 任务可省大量重复计算
sh_reya · x · 2026-10-02
作者看好 workload-aware inference:数据库系统正是靠利用负载知识换取性能的典范,如今任何带声明式接口、且 LLM 推理需求增长的系统都适合引入这一思路。
她引用自己的讨论指出:一个批处理数据流水线通常含多个 LLM 操作,API 方式下每行每操作各发一次调用、独立处理。若预先知道全部请求,就可以整任务规划——在同一操作内重排请求以共享 KV cache、先执行选择性最高的过滤器、跨操作复用文档的 KV cache。规划之外还可改变执行方式:知道哪些请求共享前缀时,可换用不同的 attention kernel,让共享 KV 只从 HBM 读一次而非每请求读一次。
「Infra」频道最新
- 估值 130 亿美元的 Baseten 押注开源:别租智能,基建才是瓶颈 — baseten · 2026-10-02
- Kaigen 引擎 C 语言实现跑分胜 Unity:开启多线程对比 Boids 场景 — gdechichi · 2026-10-02
- a16z 拆解 AI 基建资金流向:每 100 美元 50 个进芯片,20 个进电力 — demian_ai · 2026-10-02
- GPU 开销去哪了:训练、推理还是闲置? teams 的真实账单讨论 — Borges_Engineer · 2026-10-02
- SemiAnalysis:16% 的 Rubin 计算裸片面积耗在 HBM 控制器与 PHY 上 — BenBajarin · 2026-10-02
- Modal Clusters 正式上线:RDMA 节点按秒计费,一个装饰器起集群 — josh_wills · 2026-10-02