小红书推专用引擎GR-Inference,Beam搜索吞吐翻倍

小红书技术REDtech · wechat · 2026-09-01

小红书搜索侧采用基于 SemanticID 的生成式召回(GR),具有长上下文、短解码、大 Beam 的负载特征,通用框架难以高效支持。为此,小红书与 NVIDIA 联合构建了专用推理引擎 GR-Inference。

核心设计

核心 Kernel 优化

性能表现

在 Qwen3-0.6B 模型、固定 Beam 900、E2E 延迟 <100ms 的测试条件下:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →