数据库老兵押注负载感知推理:批处理 LLM 任务可省大量重复计算

sh_reya · x · 2026-10-02

作者看好 workload-aware inference:数据库系统正是靠利用负载知识换取性能的典范,如今任何带声明式接口、且 LLM 推理需求增长的系统都适合引入这一思路。

她引用自己的讨论指出:一个批处理数据流水线通常含多个 LLM 操作,API 方式下每行每操作各发一次调用、独立处理。若预先知道全部请求,就可以整任务规划——在同一操作内重排请求以共享 KV cache、先执行选择性最高的过滤器、跨操作复用文档的 KV cache。规划之外还可改变执行方式:知道哪些请求共享前缀时,可换用不同的 attention kernel,让共享 KV 只从 HBM 读一次而非每请求读一次。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →