Meta 发布 MTIA 300:内置网卡芯片组的首款训练专用加速器
Meta_Engineers · x · 2026-08-31
Meta 官方工程博客详细介绍了 MTIA 300——其自研 MTIA 加速器家族中首款针对排序与推荐模型训练优化的芯片。
- 与需要巨大浮点吞吐的 LLM 不同,推荐模型的瓶颈在于加速器间通信:嵌入表可占模型参数的 99% 以上,混合并行会在数百个加速器间产生频繁的 AllReduce、AllToAll、AllGather 集合通信。
- 在 GPU 上,这些通信操作与训练计算争抢同一资源,常导致昂贵硬件利用率低下。
- MTIA 300 通过内置 NIC 芯片组和通信卸载引擎,将通信变成芯片设计的一等公民,在推荐模型训练的通信需求上性能优于通用 GPU。
- Meta 还与芯片协同设计了通信库 HCCL,从根本上改变芯片设计方式。
详细内容来自 @Scale: Networking Conference 的技术分享。
所属事件:Meta 发布 MTIA 300:首款训练专用自研加速器(2 条相关)→
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01