NVIDIA Technical Blog:Agentic AI / Generative AI·· 29 天前AI 评分38
NVIDIA 全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户
How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra
AI 导读
NVIDIA 在 4xB200 系统上对 Nemotron 3 Ultra NIM 2.0.12 优化后,系统输出吞吐从基线的 718 tok/s 提升至 1,997 tok/s,在 50 TPS/user 目标下并发用户数提升超 2.5 倍。
整理与数据来源:AIHOT
来源:NVIDIA Technical Blog:Agentic AI / Generative AI · developer.nvidia.com