NVIDIA Technical Blog:Agentic AI / Generative AI·· 25 天前AI 评分40
NVIDIA Transformer Engine 如何用 JAX 加速 Dropless MoE 训练
Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine
AI 导读
NVIDIA 在 JAX 中用 Transformer Engine 优化 Dropless MoE 训练,在 NVIDIA GB200 上跑 DeepSeek-V3 时,未优化基线仅 103 TFLOPS/GPU、GPU 间通信占累计 kernel 时间 84%,经针对性 kernel 优化后升至 1,068 TFLOPS/GPU,提升 10.4 倍。
整理与数据来源:AIHOT
来源:NVIDIA Technical Blog:Agentic AI / Generative AI · developer.nvidia.com