跳到正文
原文
NVIDIA Technical Blog:Agentic AI / Generative AI·· 29 天前AI 评分38

NVIDIA 全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户

How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra

AI 导读

NVIDIA 在 4xB200 系统上对 Nemotron 3 Ultra NIM 2.0.12 优化后,系统输出吞吐从基线的 718 tok/s 提升至 1,997 tok/s,在 50 TPS/user 目标下并发用户数提升超 2.5 倍。

整理与数据来源:AIHOT

来源:NVIDIA Technical Blog:Agentic AI / Generative AI · developer.nvidia.com