CPU一片难求?亚马逊AWS出现「CPU短缺」!
根据《TheInformation》报导,科技业已经从聚焦于GPU一片难求的窘境,转向CPU这项基础运算资源。亚马逊云端服务(AWS)内部今年5月已对工程团队发出示警,要求全力节省运算资源,以确保未来能持续满足客户需求。
值得注意的是,这波节流令不仅锁定AI芯片,更直指长年支撑网络服务运作的传统CPU服务器。
知情人士透露,AWS已对各部门下达期限,要求在今年稍晚前削减运算资源的占用比例。为了腾出算力转供外部客户使用,工程师们正陆续关闭先前用于软件开发、如今处于闲置状态的EC2虚拟服务器。
一名任职AWS多年的工程师表示,过去申请CPU服务器资源通常数小时内就能到位,如今却得苦候数天之久,这样的延迟在他的职涯中前所未见,甚至可能拖累项目交付时程。
对此,AWS官方回应强调,尽管当前面临「庞大需求」,公司仍有能力满足「绝大多数」内外部客户的运算需求,并表示正与内部团队密切合作,确保EC2资源维持一贯的高效运用,员工使用资源的相关指引也未因目前的紧张情势而调整。
值得留意的是,外部客户目前受到的影响仍属有限。一名协助企业导入AWS服务的顾问指出,尚未观察到客户在合约承诺的算力上出现实际短缺。
不过,AWS以折扣价提供、但可随时在两分钟内被收回的「竞价实例」(SpotInstances),近几个月来已越来越难大量取得,被视为AWS整体供需缺口正在收窄、弹性空间持续压缩的明确讯号,也可能预示云端运算成本即将走高。
分析指出,这波CPU吃紧的根本原因,在于「AI代理」应用的快速扩散。AI顾问公司ElendilLabs共同创办人暨董事总经理JingXie观察到,客户的人均IT支出已然翻倍,主因正是企业内大量导入AI代理程序协助软件开发。
他指出,AI代理程序在运作过程中往往需要调用比以往更多的云端资源,进而对CPU形成持续性的庞大需求。
他表示:「不论是现在的开发、生产或营运,几乎所有工作所需的CPU都比过去更多。」
事实上,CPU的角色不仅限于AI应用的执行端,在AI开发流程中同样不可或缺。例如AI公司为训练模型准备数据时,仍须仰赖CPU从文件、影像与影片中读取并处理原始数据。
芯片大厂的最新表态也印证了这股趋势。英特尔执行长陈立武(Lip-BuTan)今年4月的财报电话会议上曾透露,在AI推论(即模型实际运作)情境中,CPU与GPU的使用比例约为1比4。然而,到了7月,该公司财务长DavidZinsner便指出这项比例已迅速拉近至接近1比1。
AMD与Arm的高层主管近期也做出类似表态,显示CPU需求成长的速度已超出业界原先预期。
除了CPU本身供不应求,与之搭配使用的内存芯片供应紧张,以及数据中心实体空间的限制,也共同加剧了这场算力荒。
大型科技公司的算力分配难题如何在内部研发与外部客户之间分配有限算力,已成为近两年科技巨头共同面临的棘手课题。
外媒先前报导,Google去年已成立一个由高阶主管组成的专责委员会,负责协调GoogleCloud、DeepMind研究部门与消费端业务之间的运算资源分配。
即便如此,内部摩擦仍未消弭。Google知名AI研究员NoamShazeer今年稍早便因不满算力取得受限而选择离职。
相较之下,微软则展现出算力管理效率提升所带来的正面效益。该公司财务长AmyHood上月在财报电话会议上表示,Azure云端服务部分营收成长,正是得益于CPU与GPU丛集管理效率的提升。
