中科曙光落成全国首个十万卡全国产AI超集群,算力自主可控实现新突破
近日,中科曙光正式宣布,国内首个完全基于全国产算力硬件搭建的十万卡级
AI
超集群完成部署并投入运行。这一里程碑式的成果,标志着我国在高端AI算力基础设施领域彻底突破了海外技术壁垒,实现了从核心芯片、高速互联到
操作系统
全链路的全国产化,为国内大模型训练、AI产业的自主发展筑牢了关键底座。
这个十万卡AI超集群的核心亮点,在于其100%的全国产化属性。不同于以往部分依赖进口硬件的超算集群,该集群从底层AI加速芯片、高速互联网络,到算力调度系统、基础软件栈,全部采用国内自主研发的技术方案,没有任何海外供应链的“卡脖子”风险。中科曙光依托自身在算力基础设施领域数十年的技术积累,完成了全栈国产硬件的深度适配优化,解决了十万级规模算力节点之间的
通信
延迟、协同调度等一系列行业难题,让数万颗国产AI芯片能够高效协同工作,整体算力利用率达到了国际先进水平。
在技术实现层面,十万卡规模的AI集群搭建本身就面临着极高的挑战。当算力节点规模突破十万级时,集群内部的通信量会呈指数级增长,任何一个节点的微小延迟,都可能在大规模协同训练中被放大,导致整体算力效率大幅下降。中科曙光通过自主研发的高速无损互联网络技术,搭配定制化的分布式算力调度系统,实现了集群内节点之间的毫秒级低延迟通信,同时针对大模型训练的特性优化了任务分配逻辑,让十万颗国产AI芯片能够像一颗“超级芯片”一样协同工作,完全可以支撑万亿参数级大模型的高效并行训练。
这个超集群的落成,也将彻底改变国内AI产业的算力供给格局。此前国内头部AI企业在训练超大规模大模型时,往往面临高端算力供给不足、供应链不稳定的问题,而这个全国产十万卡AI超集群的投入使用,将为国内科研机构、AI企业提供稳定、自主可控的高端算力支撑,不用再受海外硬件出口限制的影响。无论是基础科学研究中的AI模拟计算,还是通用大模型、行业大模型的迭代训练,都能在这个集群上安全高效地完成,从根源上保障我国AI产业的发展主动权。
作为国内算力基础设施领域的领军企业,中科曙光此次落地全国首个十万卡全国产AI超集群,是我国算力自主化进程中的关键一步。它不仅验证了国产AI硬件在超大规模场景下的可用性,更构建起了一套完全自主可控的高端算力生态,为后续更大规模的国产AI集群建设打下了坚实的技术基础。随着这个超集群的正式投用,我国AI产业将彻底摆脱对海外算力供应链的依赖,在全球
AI技术
竞争中掌握更多的主动权。
操作系统
操作系统
+关注
关注
37
文章
7504
浏览量
130167
中科曙光
中科曙光
+关注
关注
5
文章
550
浏览量
19102
AI算力
AI算力
+关注
关注
1
文章
238
浏览量
10142
大模型
大模型
+关注
关注
2
文章
4037
浏览量
5452
