Meta 混合 GPU-CPU 检索系统:十亿级 GPU 池加 20 倍 CPU 库存
_reachsumit · x · 2026-09-21
Meta 发表面向超大规模个性化搜索的混合检索系统论文,已在生产环境部署。
- 核心矛盾:万亿级文档场景下,「深度个性化」与「广覆盖」冲突——全库存放 GPU 显存成本过高,CPU 又跑不动交互密集模型。
- 方案:用编排而非新模型化解——GPU 路径在约十亿文档的精选在线池上做深度融合检索与交互预排序;CPU 路径用轻量个性化打分搜索约 20 倍规模的独立库存。两条路径可单独或同时运行,候选去重后进入共享下游排序。
- 效果:全系统 A/B 测试相对纯 CPU 旧配置提升了模型打分相关性与实质互动;两条路径各自部署范围内也验证了正向价值。
「Infra」频道最新
- 个人 Agent 爆发成 NAND 闪存需求激增的最大推手 — zephyr_z9 · 2026-09-21
- Grammarly 拆解支撑每周 1000 亿次 LLM 请求的推理架构 — jefrankle · 2026-09-21
- 本地推理 VRAM 玄学:单卡 R9700 32GB 够用还是该趁涨价前加卡? — endgamedos · 2026-09-21
- 黄仁勋称数据中心耗水是迷思:新机房冷却水可回收、全年蒸发不及一个泳池 — rohanpaul_ai · 2026-09-21
- 新论文实现消费级 GPU 上亚秒级交互式扩散图像生成 — chaumian · 2026-09-21
- Jev 稀疏注意力接入 MiniMax H3,视频生成提速超 40% — Repulsive_Gap_1678 · 2026-09-21