PreFT 论文入选 NeurIPS:仅 Prefill 阶段用 LoRA,多适配器推理提速
aryaman2020 · x · 2026-09-25
新论文提出 Prefill-Only Fine Tuning(PreFT):Prefill 与 decode 是两类差异很大的推理负载,同时服务多个 LoRA 适配器时,decode 阶段因内存瓶颈严重拖慢推理。PreFT 让适配器只在 prefill 阶段训练与应用、decode 阶段不再需要,从而在性能损失有限的前提下显著加速多适配器 serving。论文已被 NeurIPS 接收。
「Infra」频道最新
- Quail 深度解析:自研调度器与 vLLM 内核如何炼成 1B token/分钟 — sh_reya · 2026-09-25
- Modal 联手开源 Quail:AI-SQL 引擎单 H100 每分钟跑 10 亿 token — sh_reya · 2026-09-25
- Agent 代码淹没 CI:Anthropic 六个月 CI 任务量暴涨 25 倍的应对 — JeremyCMorgan · 2026-09-25
- SemiAnalysis 预测:Cerebras、Groq 等芯片初创正变身 neocloud — johncoogan · 2026-09-25
- Anthropic 拟 7 年投 116 亿美元租 Akamai 云,验证分布式推理论 — pdamodaran · 2026-09-25
- 穆迪:五大超大规模厂商未来承诺达 2.8 万亿美元,两年暴涨八倍 — rohanpaul_ai · 2026-09-25