2xRTX 3090 实测:小模型预填充让 32K 上下文 TTFT 降 2.2 倍

teortaxesTex · x · 2026-08-11

开发者基于 vLLM 框架,使用两张 RTX 3090 成功复现了 NVIDIA 的一项推理优化论文。

核心机制是解耦预填充:用一个小模型处理长文本的预填充,再将生成的 KV Cache 传递给一个完全不同的大模型进行解码回答。

实测效果显著:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →