Tuning Collective Patterns to Alleviate Congestion in Shared AI Clusters
本文提出名为 REACT 的系统,可在共享 AI 集群中通过调整 GPU 节点间的数据交换模式来缓解网络拥塞。该系统运行于应用层,利用现有流量统计实时检测拥塞并动态修改通信集合(如 AllReduce 树中的聚合节点),无需底层网络基础设施支持即可由用户单方面部署。原型在 NCCL 上实现,并在共享学术 GPU 集群中测试,结果显示在网络拥塞下算法带宽性能提升 13%-38%;跨多种拥塞场景的模拟进一步表明性能最高可达 75%。