润和软件探索智算集群与异构算力治理新路径
9月16日,“面向Agent时代的
AI
Infra技术趋势Workshop”于上海举办。本次Workshop作为华为全联接大会2026“Day 0”系列活动之一,以“共筑生态 聚智全球”为主题,旨在凝聚共识,寻找Agent时代AI Infra产业出海同心同路人,通过梳理Agent/MaaS生态伙伴、定义AI Infra 2.0标准架构,为未来中东、中亚AI
DC
技术白皮书及WAICO技术路线奠定基础。江苏润和软件股份有限公司(以下简称“润和软件”)受邀参会,围绕大规模智算集群全链路运维与算力资产增效开展主题分享,介绍面向万卡级场景的智算集群与异构算力治理技术思路,同时围绕国产AI基础设施出海展开行业探讨。
研讨会上,润和软件智算事业部解决方案总监巩远波发表《润和软件Token工厂:AI Infra全链路智能运维的探索与实践》主题演讲。他指出,大规模集群运维的核心难点不在于单点设备监控,而在于芯片驱动、容器运行时、网络总线、硬件带外管理、能效控制、负载编排、训练自愈七层对象的全链路协同,任何一层出现割裂,都可能造成集群整体Token产出下降。
当前万卡级智算场景快速演进,行业发展同时面临六大现实痛点:
故障常态化:集群规模越大硬件故障概率越高,直接侵蚀有效训练时长
五维异构难题:多品牌算力硬件混跑,带来算力混池效率损耗
网络瓶颈:大规模集群中网络建设成本高,同时容易成为业务性能短板
推理性能墙:MoE等模型场景下推理吞吐存在明显差距
训推冲突:训练、推理任务争抢算力资源,小作业资源利用率偏低
电力空耗问题:即便业务负载不高,硬件依旧维持峰值功耗,推高智算
中心
运营成本
针对上述行业痛点,润和软件基于openEuler开源底座,打造Token工厂AI Infra全链路智能运维技术方案,分层破解大规模智算集群的各类挑战。
异构基础层,化解算力“碎片化税”
依托超节点
操作系统
基座与iSulad统一容器运行时,屏蔽多厂商软硬件异构差异,完成驱动、固件、AI框架的统一基线治理;基于KubeOS实现操作系统的云原生生命周期编排,支持节点OS在线升级、镜像重装、故障回滚,夯实万卡智算集群稳定运行底座。
统一高速网络层,释放集群
通信
效能
完成灵衢总线适配优化,结合AI场景RoCE拥塞控制、DPU卸载能力,实现多厂商网络设备统一纳管,提升集群通信效率,降低网络综合投入。
硬件监控遥测层,实现故障自动闭环处置
采用带外监控方案,近乎零业务开销采集硬件健康指标,实现秒级故障识别;联动调度组件完成任务自动迁移与训练续训,减少硬件故障带来的算力损失。
能效管理层,打造负载自适应的智算中心
搭建“预测-执行-反馈-修正”的能效闭环,根据训推业务潮汐特征动态调节功耗;结合电价、绿电、碳排放约束调度可延迟任务,在保障业务SLA前提下降低算力运营成本。
负载自动化编排层,实现异构算力统一池化调度
打造AI原生调度器,支持拓扑感知调度、训推混部、多约束资源放置、故障自愈,实现各类异构算力统一调度管理,提升整体资源利用效率。
未来,润和软件将持续依托openEuler开源生态,迭代完善Token工厂AI Infra全链路智能运维相关技术,持续探索Agent时代 AI Infra 建设新思路,携手产业伙伴共同推进智算产业创新发展。
江苏润和软件股份有限公司(简称“润和软件”)成立于2006年,2012年在深圳证券交易所创业板上市(证券代码:300339),是首批国家规划布局内重点软件企业、全国文明单位。公司总部位于南京,在北京、上海、深圳、香港等22个国内主要城市设有研发中心或分子公司,在日本、新加坡、越南等国设有海外分支机构,全球员工约17000人,拥有全球化的技术整合、客户响应与服务到达能力。
秉承“做民族软件脊梁,担世界进步责任”使命,润和软件以“AI转型共建者、AI落地护航者、AI价值兑现者”为核心定位,致力成为中国数智技术与服务创新的引领者。公司依托多年深耕行业的深厚积累、软硬件一体化解决方案与全生命周期服务能力,助力客户数字化转型与智能化升级。
AI
AI
+关注
关注
92
文章
45996
浏览量
306738
算力
算力
+关注
关注
2
文章
2411
浏览量
17351
润和软件
润和软件
+关注
关注
1
文章
475
浏览量
2551
原文标题:华为全联接大会2026丨润和软件探索异构算力治理新路径,赋能智算资产增效
文章出处:【微信号:hoperun300339,微信公众号:润和软件】欢迎添加关注!文章转载请注明出处。
