Meta 推荐系统达 LLM 规模,自研注意力内核使训练效率翻倍
Meta_Engineers · x · 2026-08-05
Meta 官方发文透露,其驱动 Instagram 和 Facebook 广告的生成式推荐模型(GEM)已跨数千张最新 GPU 进行 LLM 规模的训练。由于标准 LLM 基础设施无法直接用于推荐工作负载,Meta 团队协同设计了多种定制化底层组件:
- 定制内核:包括 Jagged Flash Attention (JFA)、BlockAttention 以及支持 MXFP8 的超低混合精度等。
- 架构优化:采用 5D 并行架构以适应网络拓扑。
通过这些优化,Meta 在 12 个月内将总训练 FLOPs 扩大了 4 倍,同时将端到端训练效率(MFU)翻倍至 20–25%。
所属事件:Meta广告推荐模型达LLM级规模且训练翻倍(3 条相关)→
「Infra」频道最新
- AMD 宣称 Helios 架构性价比碾压英伟达 Vera Rubin — Beth_Kindig · 2026-08-05
- 日均烧 13 万美元?DeepSeek API 真实调用量揭秘 — teortaxesTex · 2026-08-05
- 美国 NSF 斥资 1 亿美元建设区域性 AI 基础设施中心 — mkratsios47 · 2026-08-05
- Chutes AI 全面启用 TEE 验证,8x RTX 5090 算力性价比超专业卡 — markjeffrey · 2026-08-05
- engyai 上线 OpenRouter 最廉价 Kimi K3 API,成本降半 — const_reborn · 2026-08-05
- LiquidAI 新模型实测:Mac 本地跑 128K 上下文解码达 82 tok/s — helloiamleonie · 2026-08-05