NVIDIA Vera CPU架构如何加速代理式AI的存储处理能力
存储是每个代理式
AI
工作流中不可或缺的组成部分。当智能体检索企业知识、访问持久内存、重用键值 (KV) 缓存数据、执行工具并生成新结果时,存储系统必须持续提供和保存驱动智能体推理循环所需的数据。
每个智能体执行步骤都会触发多次存储操作,而随着上下文窗口越来越大,这些操作还会以数以千计并发智能体中重复执行。要提供和保存这些数据,绝非仅仅是基本的读取和写入操作那么简单。AI 推理虽然在
GPU
上运行,但代理式进程、工具调用、数据管理任务以及支持它们的存储服务在
CPU
上运行。
在写入过程中,存储系统可能会压缩和加密数据,并计算校验和以及计算冗余信息。在读取过程中,存储系统可能验证、解密、解压缩或重建数据,然后再将其返回给应用程序。这些功能对于 AI 系统的安全性和弹性至关重要。当数据通过存储路径传输时,每个功能还需要额外的 CPU 处理。
随着智能体并发量 (多个用户、AI 智能体或并行运行的任务) 和上下文数据量的增长,存储系统必须在不限制应用响应速度或 Token 生成速度的前提下,执行更多此类工作;它必须以加速计算所需的速率提供数据。
其中许多功能直接位于数据路径(Data Path)中;任何一次操作发生延迟,都可能拖慢整个数据流。如果使用传统 CPU 来扩展这些功能,往往需要投入更多的 CPU 核心、功耗和散热资源,这不仅增加了基础设施成本,而且系统的最终性能依然受限于最慢的步骤。如果负责数据安全(加密)、数据保护(冗余校验)和数据准备(解压)的
处理器
无法跟上节奏,即使配备更快的固态硬盘(S
SD
)和网络也无法充分发挥其性能潜力。
缩小存储处理差距
作为 AI 原生数据平台基础的 NVIDIA STX 参考架构的核心组件,NVIDIA Vera BlueField-4 STX 存储处理器将 NVIDIA Vera CPU 的性能直接引入到存储数据路径中。这种旨在为 NVIDIA Rubin GPU 提供持续数据的 Vera CPU 架构也加速了 CPU 侧的存储处理。
基准测试结果表明,在数据加解密、数据恢复、数据完整性校验、数据压缩和解压缩及多阶段存储流水线等各项测试中,Vera 的性能均优于 x86 CPU。这些提升使得存储平台能够在消耗更少 CPU 算力和功耗开销的前提下,处理更多数据并应用关键的企业服务,同时更高的压缩吞吐量有助于降低存储容量和网络带宽的需求。
本文阐述了 BlueField-4 STX 中的 Vera CPU 如何加速代理式 AI 所需的存储处理,从而帮助 AI 原生存储平台在提高存储处理吞吐量与效率的同时,实现对更多数据的安全防护、冗余保护、有效验证和高效压缩。
Vera CPU 架构:专为满足存储的双重需求而打造
Vera CPU 包含 88 个 NVIDIA 设计的 Olympus CPU 核心,这些核心与
Arm
v9.2 指令集完全兼容。该 CPU 支持 176 个 NVIDIA 空间多线程(Spatial Multithre
adi
ng)线程。它将 these 核心与 NVIDIA 可扩展一致性总线网络架构结构 (Scalable Coherency Fabric,SCF) 、Small Outline Compression Att
ac
hed Memory Module (SOCAMM2) LP
DDR
5X 内存相配合,以在 AI 工厂规模维持强大的单线程性能与高吞吐量的 CPU 执行能力。
SCF 提供跨核心、共享缓存、内存
控制器
和 I/ O 的一致性片上(On-die)数据路径,具有高达 3.4TB/s 的对分带宽(Bisec
ti
on Bandwidth) and 164 MB 的统一 L3 缓存。随着工作负载在整个处理器中的扩展,这为运行中的核心提供了通往共享数据的高带宽、可预测访问能力。SOCAMM2 LPDDR5X 内存子系统与该总线网络架构互为补充,可提供高达 1.2TB/s 的综合内存带宽,即每个核心高达 1
4G
B/s,确保 NVIDIA Olympus 核心在带宽密集型和高并发工作负载中获得持续的数据。这种模块化、可现场替换(field-replaceable)的内存,将 LPDDR5X 的高能效与数据
中心
基础设施所需的可维护性和可靠性相结合。
存储原语基元对 CPU 提出了两种截然不同的要求。首先,在每个数据流中,必须快速完成加密、完整性校验检查、数据恢复、压缩和解压缩,然后才能继续进行后续存储处理,因此持续的每核心性能至关重要。其次,在整个系统中,这些操作在许多并发数据流上运行,并在缓存和内存中频繁传输数据,因此带宽和可预测的延迟同等重要。
Vera 完美兼顾满足了这两个要求。Olympus 核心融合了宽指令吞吐量(Wide Instruction Throughput)、高级分支预测、深度乱序执行(Out-of-Order Execution),以及丰富的向量和加密计算资源,从而助力帮助每个核心在控制密集型代码和数据处理型代码中维持稳健的指令吞吐量。
NVIDIA 空间多线程、单片整体式计算裸片、可扩展一致性总线网络架构 SCF、统一的 L3 三级缓存以及高带宽 SOCAMM2 内存,共同确保了为运行中的核心提供数据,同时减少线程之间的相互干扰,并支持在高负载情况下提供更具可预测性的数据访问能力。以上特性的协同运作,很好地共同有助于解释了存储系统在加密、完整性校验检查、奇偶校验计算、数据压缩以及多阶段存储流水线管道中所展现出的性能提升。
使得 BlueField-4 STX 存储处理器能够在多个并发数据流中承载更高多的 CPU 侧存储处理能力,而不会按比例增加 CPU 资源、功耗和散热。
衡量基础存储性能
存储任务会在存储的读取、写入和恢复路径中反复执行。其吞吐量和效率直接决定了 CPU 侧的处理能力是否能够跟上 SSD 和网络的节奏,是否会成为数据路径中的性能瓶颈。本文中的存储原语微基准测试(Microbenchmak
rs
)独立抽离了这些功能,以衡量处理器所做出的性能贡献。测试结果展示了 Vera 所具备的 CPU 性能和算力余量(He
ad
room),可用于构建更高吞吐量、更高效的存储服务。
每项测试均在单个进程内运行,且使用已保存在内存中的数据。除非另有说明,否则这些测试均排除了文件 I/ O、磁盘性能、网络传输、命令启动以及外部设备瓶颈等因素。基准测试集采用了包括 OpenSSL、Zstandard 和 LZ4 在内的通用库,以及针对 Arm 和 x86 处理器上可用原生指令集进行优化的同等
算法
实现。
一个专用测试框架负责一致地运行每个工作负载,并控制缓冲区大小、线程数量、CPU 分配、计时、正确性校验和结果收集。测试涉及的算法及许多软件实现均已被广泛采用。该测试框架在 Vera 和 x86 平台上应用了完全相同的工作负载定义和控制逻辑,从而实现了严谨一致的处理器性能对比。尽管这套完整的基准测试集并非现成的公开基准测试,但可以使用源代码、脚本、固定软件版本、配置和结果文件来复现结果。
这些测试结果确立了 Vera 在存储构建块(Storage building blocks)上的性能表现,而这些构建块直接影响着数据的安全传输、可靠性、容量效率和服务密度。生产存储路径通常会对同一数据施加上述多种操作,从而导致其 CPU 处理需求不断累加。
当在生产存储软件中结合使用时,这些独立操作的性能表现共同构成了存储系统的综合吞吐量和 CPU 使用效率。在各个存储原语及多阶段流水线上实现更高的吞吐量,能够为存储软件提供更充裕的 CPU 算力余量,使其得以跟上 SSD 和网络的节奏,支持高并发数据流,并高效地应用关键的数据服务。不过,要量化最终对整个存储系统或 GPU 性能的影响,仍需要进行端到端的完整测试。
利用更快的加密技术保护更多 AI 数据
AI 工厂需要处理敏感信息,包括模型资产、企业知识、智能体上下文、提示词(Prompts)、输出内容和客户数据。AES-128 被广泛应用于静态数据(Data-at-rest)和传输中数据(Data-in-flight)的加密。加密直接位于写入路径中,其吞吐量直接决定了平台在加密成为性能瓶颈之前,每秒能够处理多少安全数据。与参与对比的 x86 CPU 相比,Vera 提供了高达 1.43 倍的 AES-128 加密吞吐量。

图 1. NVIDIA Vera 加速 AES-128 存储加密
解密则在读取路径上执行对应的逆向相应操作,与参与对比的 x86 CPU 相比,Vera 提供了高达 1.29 倍的 AES-128 解密吞吐量。

图 2. NVIDIA Vera 加速 AES-128 存储解密
更高的加密吞吐量使存储系统能够在不限制写入性能的前提下保护更多数据,而更高快的解密吞吐量速度可缩短减少将受保护的数据返回给智能体、应用程序或加速器所需的时间。这些优势有助于存储系统在保护并返回不断增长的 AI 数据量的同时,而不会占用消耗越来越多的存储性能预算。
更快地保护和恢复 AI 数据
存储平台采用纠删码 (Erasure Coding)技术,用于在当
驱动器
硬盘、节点或数据块片段发生故障/变得不可用时,保护数据。Reed-Solomon 编码会通过计算产生冗余数据,而数据恢复过程则利用使用这种冗余数据来重建丢失或损坏的数据。编码通常发生在写入路径上。而数据恢复则发生在重建、修复或降级读取性能降低期间。由于这两类操作采用了不同的计算和内存访问模式,它们的性能测试结果也会有所不同。
在数据恢复工作负载中,Vera 可提供比 x86 CPU 高 3.26 倍的 Reed-Solomon 吞吐量。

图 3. NVIDIA Vera 加速 Reed-Solomon 存储恢复
更高的 Reed-Solomon 吞吐量使存储系统能够更快地写入受保护的数据,并更迅速地重建丢失的数据。在选定的效率指标
测试测量
中,Vera 还能在可用的 CPU 功耗功率范围内完成了更多的冗余保护工作,从而这有助于缩短数据重建时间,并减少对与正常数据服务的资源争抢。
以更高的吞吐量校验验证数据完整性
数据在传输、存储和检索时必须保持准确正确。循环冗余校验 (CRC) 通过创建校验和,供存储系统用于检测意外的数据损坏。
CRC 和 Reed-Solomon 发挥着互补的作用。CRC 用于检测到数据是否不再符合预期结果。而 Reed-Solomon 则提供了用于重建缺失或损坏信息的冗余数据。
存储系统可能会分别在写入和读取路径上均计算 CRC,包括在缓冲区之间复制数据时。随着数据量的不断增长,这些校验检查操作可能会消耗大量 CPU 资源。
Vera 提供的 CRC32C 吞吐量比 x86 CPU 高 3.67 倍。

图 4. NVIDIA Vera 加速 CRC32C 存储完整性检查
更高的 CRC32C 吞吐量使存储系统能够校验更多的数据,而不会让完整性校验成为读取或写入操作的限制因素。对于代理式工作负载而言,这有助于以更低的 CPU 侧处理延迟,返回可靠的上下文、持久记忆内存和企业数据。
通过更快的压缩和解压缩减少数据占用空间
代理式 AI 会生成越来越多的上下文、日志、检查点、检索数据、中间输出和持久记忆内存。数据压缩不仅能够减少保存会降低这些数据所需的存储容量,还能降低传输和移动数据所需的带宽需求。而解压缩则可在读取数据时将其还原恢复。根据存储架构的不同,压缩可以在线事实运行,也可以在后台运行,而当在读取已压缩的数据时,解压缩通常是必不可少的一步。压缩吞吐量会影响降低数据被缩减的速度,而解压缩吞吐量会影响存储系统向代理式 AI 应用程序将数据返回数据至代理式 AI 应用的速度。以下基准测试分别对这两项操作进行了独立测试衡量这些运算。
与 x86 CPU 相比,Vera 提供了高达 3.29 倍的压缩吞吐量,并且在所有被测线程数下均保持这一优势。

图 5. NVIDIA Vera 加速存储压缩
解压缩基准测试测量了读取已压缩数据时的对应逆向相应操作。在高并发条件下,Vera 提供的解压缩吞吐量比 x86 CPU 的并发吞吐量高 1.72 倍,且随着并行运行的工作线程数量增加,其性能优势愈发明显。

图 6. NVIDIA Vera 加速存储解压缩
压缩性能会因算法、数据特征、压缩等级、缓冲区大小和线程数量的不同而有所差异,因此上述测试结果仅针对特定的被测试工作负载。更高的压缩吞吐量使存储系统能够减少写入、存储和传输的数据量,同时保持 CPU 侧处理性能。
更高的解压缩吞吐量有助于存储系统更迅速地将解压缩后的数据返回给智能体和应用程序。这些能力协同发力,在缓解传输带宽的压力、降低容量的同时,确保随着代理式 AI 工作负载不断增长,每个处理器都能压缩和解压缩更多的数据。
加速多阶段存储写入路径
存储系统极少单独执行某项数据服务。一条安全的数据写入路径可能先对数据进行压缩以减少其占用空间,然后在数据写入之前对其进行加密。本基准测试集包括一个内存驻留流水线工作流,该流水线工作流对每个数据缓冲区依次执行先应用压缩,和后加密的操作。与先前测试衡量单项操作的基准测试不同,当两个 CPU 密集型的存储功能函数依次执行时,该测试测量了整个流水线的吞吐量。
对于包含两阶段流水线,Vera 可提供的流水线总吞吐量比参与基准测试的 x86 CPU 高达 3.21 倍。

图 7. NVIDIA Vera 可加速多阶段压缩和加密工作流。
该结果表明,Vera 的性能优势不仅限于之前测量的单项操作,还扩展到了代表存储写入路径(既需要缩减数据,又需要保护数据)的多阶段序列中,从而减少并保护数据。更高的多阶段流水线工作流性能使存储系统能够处理每个处理器上处理的更多的数据,随着代理式 AI 数据量的不断增长,有助于维持写入吞吐量。
利用 Vera 扩展智能体执行和存储能力
代理式 AI 将 CPU 执行和存储处理成为同一 AI 工厂数据路径的一部分。
CPU 在模型调用之间运行工具、代码、检索、分析和数据处理步骤。存储系统则对这些步骤所需的数据进行保护、校验、压缩和返回。两者都必须在整个 AI 工厂可用的有限 CPU、功耗和散热资源范围内实现高效的扩展。
Vera 专为加速代理式 AI 时代依赖 CPU 的工作负载而设计。在 NVIDIA Vera Rubin 中,它充当 NVIDIA GPU 的主机 CPU,并支持智能体执行。独立运行的 Vera 可将每个核心的性能提升高达 1.8 倍。而在 BlueField-4 STX 中,Vera 则为 AI 原生存储平台使用的 CPU 侧处理提供强劲算力支持。
基准测试结果表明,Vera 可加速用于安全数据访问的加密和解密,加速了 Reed-Solomon 恢复,从而在存储重建和修复期间更快地重建缺失或损坏的数据,加速了用于高吞吐量完整性校验的 CRC32C,以及加速了压缩和解压缩,从而可在降低容量和带宽需求的同时,加快数据检索速度。
通过在单项功能以及多阶段写入路径中持续提供高性能,Vera 能够帮助 AI 原生存储平台以更低的 CPU 侧延迟来处理和返回安全、可靠的数据。它还能在不按比例增加 CPU 资源、功耗和散热资源的前提下,支持更多并发数据流和更高的服务密度。在特定选定的工作负载中,Vera 还展现出可提供更高的每瓦性能,使存储系统能够在有限的功耗预算内完成更多的 CPU 侧存储处理。
贯穿跨计算和存储的通用 Vera CPU 架构和软件工具链,为扩展智能体执行能力及其底层支持的数据基础设施提供了一致的技术基础。
详细了解 Vera CPU 和 BlueField-4 STX
阅读 NVIDIA Vera CPU:专为实现代理式 AI 的最大单线程性能而打造的 Olympus Core,深入了解为这些存储处理测试结果提供支持的底层架构。
下载 NVIDIA Vera BlueField-4 STX 存储处理器数据表,了解 NVIDIA BlueField 基础设施处理器如何为加速 AI 工厂的存储、网络和安全性。
关于作者
Jason Hardy 是 NVIDIA 存储技术副总裁,负责推动
加速计
算和企业 AI 的存储架构和生态系统调整。他领导了高性能存储系统和 AI 解决方案的开发,为分析、企业和工业工作负载提供支持。跨工程、产品和行业合作伙伴的 Heworks,以推进专为 AI 环境中的规模、性能和可靠性而设计的存储架构。
Ronil Prasad 是 NVIDIA 数据中心网络解决方案的高级产品营销经理,致力于帮助企业和 AI 客户采用为现代数据中心提供支持的高性能网络平台。
