Meta 提出 ROCS 推荐推理范式,检索 QPS 最高提升 3 倍
_reachsumit · x · 2026-07-31
Meta 发布了一篇名为《ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation》的论文。
- 核心问题:现代推荐模型通过增加特征交互和序列模块提升了预测质量,但高昂的生产成本限制了系统的扩展规模。
- ROCS 范式:利用推荐推理中“单次用户请求需评估大量候选”的特性,将请求与候选对象的交互尽可能延后,隔离候选对象的表示,使模型大部分计算在每个请求中只执行一次,而非每个候选执行一次。
- 实现方法:开发了广义层掩码(GLM)来在特征交互架构中强制执行候选隔离。
- 效果:大幅减少了冗余计算,在保持或提升预测质量的同时,将检索 QPS(每秒查询率)最高提升了 3 倍。
「Infra」频道最新
- 开源 Rust 推理引擎 runNburn:内存受限下跑 295B 模型,短上下文解码比 llama.cpp 快 2.8 倍 — coderyeon · 2026-07-31
- 亚马逊称 AI 需求远未触顶,2026 年资本支出将超 2200 亿美元 — inductionheads · 2026-07-31
- 斯坦福论文提议:应强制超大型数据中心披露能耗与水耗 — ruthstarkman · 2026-07-31
- 2.8T 参数模型推理成本骤降:AMD MI355X 每百万 token 仅需 $1.75 — scaling01 · 2026-07-31
- 开源三值化 LLM 引擎 Tritium:显存占用大降且推理速度超越 llama.cpp — Wide_Big_6969 · 2026-07-31
- MiniMax RL 负责人深度解析:大规模 Agent 基础设施与训练内幕 — AI Engineer · 2026-07-31