小红书推专用引擎GR-Inference,Beam搜索吞吐翻倍
小红书技术REDtech · wechat · 2026-09-01
小红书搜索侧采用基于 SemanticID 的生成式召回(GR),具有长上下文、短解码、大 Beam 的负载特征,通用框架难以高效支持。为此,小红书与 NVIDIA 联合构建了专用推理引擎 GR-Inference。
核心设计
- Request-Centric 状态管理:以请求而非 Beam 为资源单位,分离逻辑状态树与物理存储,避免状态碎片化。
- KV 抽象优化:将 KV Cache 拆为请求级共享的 ContextKV、Beam 私有的 BeamKV 以及记录分叉拓扑的 BeamPath,解决上下文共享与隔离矛盾。
- 调度与策略:支持 Continuous Batching 以及 Fixed、Scheduled、Score-margin 三种 Beam 宽度策略。
- 执行后端:采用 Bucket-based CUDA Graph 规避调度开销,通过 Meta-data driven Replay 实现跨请求复用。
核心 Kernel 优化
- GR-Decode-Attention:三级 Kernel 协作流水线。K1 用 Tensor Core 处理密集的 ContextKV;K2 用 CUDA Core 处理稀疏的 BeamKV;K3 进行 Log-sum-exp 归并,兼顾吞吐与低延迟。
- GPU SID Trie & Constrained Top-K:将 Trie 常驻 GPU,融合前缀遍历、Token Gather 和局部 Top-K 于单一 Kernel,消除 Host-Device 同步开销。
性能表现
在 Qwen3-0.6B 模型、固定 Beam 900、E2E 延迟 <100ms 的测试条件下:
- 相比三套 SGLang 社区实现,GR-Inference 峰值吞吐提升 1.5x2.5x。
- 在 Item-constrained 场景下,相比 SGLang 提升超过 3.2x。
「Infra」频道最新
- DIT 推出 AI Token 交易所,聚合多厂商降价 30-70% — Div_pradeep · 2026-09-01
- 单月狂砸 800 亿:Anthropic 签署巨额云算力协议 — kimmonismus · 2026-09-01
- ESP32 语音助手:8倍压缩唤醒词模型实践 — carrycooldude · 2026-09-01
- LITE 推 VCSEL 用于 AI 扩展互连,产品延后 — zephyr_z9 · 2026-09-01
- antirez 演示 DeepSeek v4 Flash 视觉版在 M5 Max 上本地快速运行 — antirez · 2026-09-01
- 英伟达财报:避免算力垄断与每千瓦时美元价值 — Stratechery · 2026-09-01