当SK和英伟达建设2GW AI工厂,真正的考题才刚开始
7月24日,在旧金山举行的
AI
峰会上,SK集团与
英伟达
宣布一项备受关注的合作计划。
此前,SK电讯计划在韩国建设一座2GW AI
云计算
中心
,SK海力士将为英伟达下一代AI计算平台长期供应HBM,首座AI工厂预计于2027年投入运营。5000亿美元的合作规模足够吸引眼球,但真正让我关注的,是另一个数字——2GW。
2GW意味着什么?如果按一台AI训练服务器约10kW功耗计算,这座数据中心未来可能部署超过20万台服务器。很多人第一时间想到的是
GPU
、HBM和高速网络。
这些当然重要,但真正到了工程现场,更大的挑战往往不是算力够不够,而是这么多设备,如何长期稳定地协同运行。
真正难的,不是算力,而是时间同步
原因很简单,一台AI服务器并不是只有GPU在工作,GPU、HBM、PCIe、交换芯片、光模块等高速器件,都需要共享统一的
时钟
基准,才能保持协同运行。
如果只是单台服务器,问题还相对简单;可当规模扩大到几十万张GPU、数万个交换节点、成千上万个机柜时,情况就完全不同。
分布式训练过程中,不同服务器之间需要持续交换数据。如果节点之间的时间出现偏差,轻则增加网络重传、降低训练效率,重则影响整个任务的稳定运行。所以,大型AI数据中心拼的不只是算力,更是时间同步能力。
这也是为什么,近年来PTP(精确时间协议)和SyncE(同步
以太网
)越来越受到关注。
不过,很多人容易忽略一点:PTP、SyncE只是完成时间同步的协议,而真正决定同步精度的,是底层的参考时钟。
高速光模块、
交换机
、AI服务器通常采用低抖动差分晶振、有源晶振作为高速
接口
的参考时钟;而数据中心的PTP主时钟、授时设备和核心同步节点,则需要稳定性更高的TCXO、OCXO,甚至VCOCXO,为整个系统提供统一、可靠的时间基准。
其中,VCOCXO(压控恒温晶振)兼具恒温晶振的高稳定性和压控调频能力,能够在接收GPS、北斗等外部授时
信号
时,对频率进行动态微调,长期保持
高精度
同步,因此广泛应用于时间服务器、
通信网络
同步和高精度测试设备等场景。
目前,SJK晶科鑫已布局AI服务器和高精度时钟同步应用,产品覆盖156.25MHz、312.5MHz LVDS差分晶振、有源晶振、TCXO、OCXO以及VCOCXO等系列。其中,9.7×7.5mm封装10MHz VCOCXO采用3.3V CMOS输出,可满足高精度时间同步、授时设备及
通信
网络等应用需求,为复杂系统提供稳定可靠的时间基准。
AI工厂越大,越离不开稳定的时钟
回过头来看,SK与英伟达这笔合作,表面上是在扩建AI算力,实际上考验的是整个基础设施的协同能力。从GPU、HBM,到光模块、交换机,再到时钟系统,每一个环节都决定着AI工厂能否长期稳定运行。
AI数据中心越大,对时间同步的要求就越高;算力越强,对底层器件一致性和可靠性的要求也越高。很多时候,真正决定一座AI工厂能跑多远的,不一定是最贵的GPU,而是那些很少出现在新闻标题里的基础器件。
GPU决定AI算力的上限,而时钟决定AI算力能否稳定地跑到那个上限。
芯片
芯片
+关注
关注
463
文章
55359
浏览量
476499
晶振
晶振
+关注
关注
35
文章
3791
浏览量
74704
英伟达
英伟达
+关注
关注
24
文章
4179
浏览量
100737
