Signal YCurated AI News
更新于 8/20 09:5261 个信源

GEM 训练:Meta 如何将其 LLM 规模广告基础模型的效率翻倍

AI 产业8/4 02:00Engineering at Meta查看原文 ↗
摘要

Meta 通过硬件/软件协同设计,将广告推荐基础模型 GEM 的端到端训练效率提升至 20-25% MFU,并在 12 个月内扩大训练 FLOPs 4 倍。

核心要点
  • GEM 是 Meta 广告系统背后的推荐基础模型,拥有数万亿稀疏嵌入参数和数十亿稠密参数,服务于 Instagram 和 Facebook 的广告推荐。
  • 训练在数千块最新一代 GPU 上进行,端到端 MFU 从约 10% 提升到 20-25%。
  • 计算效率方面,开发了自定义推荐核函数库,包括 Jagged Flash Attention、Generalized Dot-Product Attention、BlockAttention,并采用 MXFP8 精度训练。
  • 扩展效率方面,使用拓扑感知 5D 并行:2D FSDP + 专家并行处理稠密参数,全分片 2D 模型并行处理稀疏参数,与 Meta 的多层网络体系协同设计。
  • 推荐系统独特的输入长度变化和不对称注意力形状导致传统 LLM 训练基础设施无法直接迁移,需要专门创新。
原文佐证
  • doubling end-to-end (E2E) training efficiency to 20–25% Model FLOPs Utilization (MFU) while scaling training FLOPs 4x in 12 months
  • customized recommendation kernel library — Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention, etc.
  • Topology-aware 5D parallelism with Streaming Multiprocessor (SM)-free collectives — 2D FSDP + Expert Parallelism for dense parameters, combined with Fully Sharded 2D Model Parallelism for sparse parameters
AI 洞察
Meta 的实践表明,推荐模型规模化训练无法简单套用 LLM 方案,需要专门的硬件/软件协同设计,这将推动超低精度和自定义核函数在推荐系统中的更广泛应用。随着广告模型规模逼近 LLM,训练效率成为广告平台的核心竞争力,Meta 的这套工程能力可能形成长期优势。未来 MXFP8 等低精度技术有望成为推荐系统训练的主流选择。