AI 产品
推文分享在NVIDIA GB200 NVL72上的AI推理性能测试结果
一篇推文分享了在NVIDIA GB200 NVL72平台上进行的AI推理性能测试结果。测试配置为4-8个prefill DEP2端点对1个decode DEP8端点,使用8192/1024的ISL/OSL,并将并发数从64扫描至5120。测试结果显示总吞吐量(Total TPS)超过每GPU 25K。需要指出的是,此数据来源于Twitter用户分享,并非NVIDIA官方发布,属于用户分享的测试数据而非官方验证结果。
多来源证据
事件时间线
- Twitter/X AI List结果:在GB200 NVL72上,4-8个prefill DEP2端点对1个decode DEP8端点,ISL/OSL为8192/1024,并发数从64扫描到5120。总吞吐量突破25K