PreFT 论文入选 NeurIPS:仅 Prefill 阶段用 LoRA,多适配器推理提速

aryaman2020 · x · 2026-09-25

新论文提出 Prefill-Only Fine Tuning(PreFT):Prefill 与 decode 是两类差异很大的推理负载,同时服务多个 LoRA 适配器时,decode 阶段因内存瓶颈严重拖慢推理。PreFT 让适配器只在 prefill 阶段训练与应用、decode 阶段不再需要,从而在性能损失有限的前提下显著加速多适配器 serving。论文已被 NeurIPS 接收。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →