构建万卡AI集群:一文掌握双平面大规模集群组网最佳实践
在当前的大语言模型(LLM)时代,随着
GPU
集群规模的不断扩张,传统的网络架构逐渐暴露出短板,严重制约了算力的有效输出。
AI
计算网络面临的困境
传统的
云计算
数据
中心
网络在面对AI训练任务时,显得力不从心。这主要体现在以下两个方面。
大象流引发的哈希极化与负载失衡
AI训练的网络流量具有周期性,且绝大多数为“大象流”(巨量数据流)。单条数据流能瞬间占满整个网卡带宽。在传统Clos架构中,经过多次转发后,这些大象流极易在ECMP机制下产生哈希极化。相同的五元组会导致流量严重堆叠,特别是在跨Pod场景中,会拖慢整个训练进程。
单点故障代价高昂,训练中断频发
AI大模型的训练容错能力极低,通常要求所有GPU同步完成迭代。任何一个ToR(接入
交换机
)或Leaf节点发生故障,都会导致大面积的训练中断。
双平面解决方案的核心设计
为解决上述问题,业界(如HPN架构)引入了双平面组网概念。相比传统的三层Clos架构,这种基于两层Spine-Leaf设计的创新架构降低了转发跳数与时延,其主要技术优势如下:
非堆叠双ToR接入,消除单点故障
传统的MC-LAG堆叠方式需要设备间连接横穿线,这不仅浪费了AI智算网络
端口
带宽,还存在控制面与转发面不同步的隐患。双平面组网采用非堆叠的双ToR高可用设计,去除了横穿线,配合ARP双发与BGP主机路由收敛,通过上行的BGP协议宣告给整个平面。让服务器网卡能够无缝对接两台上行设备,彻底消除了ToR节点的单点故障。
非堆叠方案高可用机制
物理彻底隔离,从根源解决哈希极化
如果依然采用传统的全互联网络,一张网卡分流出的数据在汇聚层依然会产生哈希极化。而在
双平面解决方案
中,网络被划分为两个完全没有物理链路互联的独立平面(如平面1和平面2)。流量从网卡发出后,被强制分流到不同的平面中转发,这种物理层面的隔离,从根本上根除了哈希极化现象。
物理隔离消除极化
端口拆分技术,实现GPU集群规模翻倍
在双平面架构下,原本需要单端口独占的400G网卡,可以拆分为两个200G端口,分别接入两个平面。这使得交换机(如864形态)的可用端口数量直接翻倍,甚至最高可支持16K至32K卡的大型集群。
双平面设计
打造具普适性的AI双平面网络
尽管HPN架构 极大地优化了网络性能,但同时也高度依赖私有定制协议(如定制LACP并要求网卡支持ARP双发等),缺乏行业普适性。对于大多数用户而言,我们需要一套基于通用标准协议的
双平面解决方案
。
绕过定制化LACP,实现双上行聚合
在AsterNOS等先进的开放网络
操作系统
中,LACP协议的实现不强制要求Port ID的严格一致性检查。这意味着,当网卡分出的两个端口分别对接到两个不同平面的交换机时,无需私有化定制协议,即可支持双上行链路聚合,直接打破了厂商锁定的壁垒。
无需定制化LACP
解决ARP双发限制
(EVPN Multihoming)
针对部分主流网卡不支持ARP双发的痛点,两台同号Leaf交换机作为EVPN的PE设备,通过管理网或者交换机AUX 10G链路(非业务端口)直连建立BGP-EVPN协议连接,共同服务于同一组GPU服务器,服务器网卡发送ARP广播通过bond负载均衡之后发往其中一个平面的Leaf设备,Leaf设备通过向VXLAN隧道泛洪ARP广播使得隧道另一端的Leaf(不同平面)同步学习到了ARP,然后两台不同平面的Leaf将学习到的ARP表项转换为32位的主机路由(ARP-to-Host Rou
te
),通过上行的BGP协议宣告给整个平面。
双上联Leaf EVPN MH技术
智能选路与自适应负载均衡
传统ECMP逐流负载均衡极易引发AI智算网络的拥塞,影响训练。针对这一问题,介绍三种替代传统逐流负载分担的技术方案:
自适应路由切换
ARS(
Ad
ap
ti
ve Routing and Switching,自适应路由切换)是一种基于Flowlet(子流)的负载均衡技术。其借助
ASIC
提供的硬件ALB(Auto-Load-Balancing)([[1]])能力,能够在减少乱序的同时实现近乎逐包负载分担的均衡性。该技术通过将哈希值相同的数据流按一定时间间隔分割成一系列Flowlet,再通过实时感知端口的带宽利用率、队列深度等链路质量指标,将Flowlet主动分配至空闲路径,从而提升整体网络带宽利用率。
智能选路(动态智能选路)
动态智能选路是一种基于感知路由的负载均衡技术,综合评估带宽使用、队列占用、转发时延等关键参数,精准判断网络路径质量。其中,带宽和队列使用基于ASIC硬件
寄存器
统计,精度达百毫秒级;转发时延基于INT(In-band Network Telemetry,带内网络遥测)技术,精度达纳秒级。各交换机实时检测路径质量,通过BGP扩展属性传递信息,并结合逐流的动态WCMP(Weighted Cost Multipath,加权多路径),将流量动态分配至最佳路径,避免网络瓶颈,提升带宽利用率。
包喷洒
包喷洒是一种逐包负载均衡技术,通过将数据包均匀喷洒到各条链路上,避免单一路径拥堵。包喷洒技术包含两种
算法
:
Random算法:将数据包随机分散至各条链路;
Round Robin算法:按顺序将数据包逐一、等量地分散至各条链路。
集群组网设计
中大规模400G AI智算双平面网络组网
上图为一个256计算节点(2048个GPU)的400G AI智算双平面Rail-optimized架构组网图,部署48台CX864E-N(16台Spine节点,32台Leaf节点),包含两个平面,每个平面16台Leaf节点和8台Spine节点。其核心设计原则如下:
每个GPU连接专用400G网卡,每个400G网卡出两个端口分别连接两个平面,每台服务器的网卡所出的第一个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 1的Leaf交换机,每台服务器的网卡所出的第二个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 2的Leaf交换机。
每个平面网络采用2层Clos架构,平面内Spine与Leaf全互联,利用IPv6 link-local特性建立unnumbered BGP邻居,宣告各Rail的网段路由,实现路由交换,无需为Leaf-Spine互联
接口
规划IP地址;
Leaf下行与上行容量的比值应严格遵循1:1收敛比,保证无阻塞传输;
Leaf、Spine交换机启用一键RoCE及负载均衡特性,构建无损网络。
设备选型
在双平面Rail-optimized组网中,单Group内的Leaf节点数量与每台服务器的GPU数量(即Rail数量)相关。以NVIDIA DGX H100 GPU服务器(每台搭载8个GPU)为例,一个Group需配置16个Leaf节点,对应8个Rail。
每个Group可接入的服务器最大数量与Leaf节点的接口形态相关。为保证1:1收敛比,Leaf节点的一半接口用于连接GPU服务器,另一半接口则连接Spine节点,因此每个Group最多可接入的GPU服务器为Leaf节点可用接口数量的一半。
下表分别为选用CX864E-N、CX732Q-N部署不同GPU数量双平面网络的节点配置需求:
总GPU数/服务器数 | Leaf节点数量 | Spine节点数量 | 每台Leaf与Spine之间的400G链路数 |
512/64 | 8 | 4 | 32 |
1024/128 | 16 | 8 | 16 |
2048/256 | 32 | 16 | 8 |
4096/512 | 64 | 32 | 4 |
8192/1024 | 128 | 64 | 2 |
16384/2048 | 256 | 128 | 1 |
(表格 1 选用CX864E-N部署不同GPU数量的双平面网络所需的节点配置需求)
总GPU数/服务器数 | Leaf节点数量 | Spine节点数量 | 每台Leaf与Spine之间的400G链路数 |
256/32 | 16 | 8 | 4 |
512/64 | 32 | 16 | 2 |
1024/128 | 64 | 32 | 1 |
(表格 2 选用CX732Q-N部署不同GPU数量的双平面网络所需的节点配置需求)
从双平面到多平面:AI智算网络的未来展望
双平面解决方案
只是网络革新的起点。随着GPU算力的飙升(如800G乃至更高带宽网卡的普及),会不约而同的向多平面网络演进。
在
AI
算力竞速的下半场,构建高可靠、高吞吐、低延迟的多平面网络,将是每个智算中心不可或缺的核心竞争力。
想要进一步了解如何为您的数据中心部署通用且高效的AI计算网架构?立即联系我们的网络架构专家,获取专属的双平面组网技术白皮书及项目评估方案!
网络
网络
+关注
关注
14
文章
8459
浏览量
96759
AI
AI
+关注
关注
92
文章
44229
浏览量
304944
组网
组网
+关注
关注
1
文章
490
浏览量
23556
