
项目背景
AI大模型训练需要GPU集群间进行大规模参数同步,对网络时延和吞吐要求极高。客户需要构建支持RoCE v2的无损RDMA网络,确保GPU间高效通信。
解决方案
部署CS9935Y系列作为Spine核心,D7726C系列作为Leaf接入,构建无收敛比的Clos网络。开启PFC/ECN拥塞控制和RoCE v2,实现GPU集群间的低时延高吞吐数据传输。
使用产品
CS9935Y 系列D7726C 系列
项目成果
GPU间通信时延降低至微秒级
RDMA网络吞吐利用率达95%以上
大模型训练效率提升30%



