Solidigm企业级SSD通过七项MLPerf Storage v3.0 工作负载——单驱动器系统的标杆成绩
本文基于 Solidigm(思得)中国区新业务拓展团队与上海芯风威科技有限公司相关团队合作测试结果撰写而成
Solidigm 交出答卷:一台服务器、一块 SSD、七项全过
Solidigm D7-PS1010 与Solidigm D5-P5336 企业级SSD通过七项MLPerf Storage v3.0 工作负载:一台服务器、一块 SSD,跑通全部工作负载,全部成绩进入 CLOSED 排行榜。

要点
两块SSD,代表了AI存储的两款企业级旗舰产品。PCIe Gen5 TLC SSD Solidigm D7-PS1010(性能)和PCIe Gen4 QLC SSD Solidigm D5-P5336(容量 --- 测试容量61.44 TB,家族最高可达122 TB)在四个v3.0工作负载中进行了测试:两个SSD均涉及 Training I/O、Checkpointing和KV Cache,D7-PS1010还包括 Vector DB。
Solidigm D7-PS1010(PCIe Gen5 TLC SSD):11.61 GiB/s Training I/O(2个模拟B200,利用率98.4%),13.00 GiB/s检查点恢复, 1194 tok/s KV Cache,140.4 QPS向量检索——一块SSD覆盖整个AI数据流水线基准测试。
Solidigm D5-P5336(PCIe Gen4 QLC SSD):5.76 GiB/s Training I/O(加速器利用率97.7%),4.98 GiB/s检查点恢复,787 tok/s KV Cache——一块61.44 TB容量的SSD,一块大容量 QLC SSD,在AI 工作负载测试中表现依然出色。
MLPerf Storage V3 是由 MLCommons 组织发布的全球权威 AI 存储性能基准测试套件的最新版本。它主要用于标准化地评估和验证存储系统在应对机器学习任务时的端到端性能。V3 版本从 V2 的训练为主的工作负载,拓展到了四项工作负载,代表了 AI 生命周期中核心的存储访问模式。
四项工作负载
Training I/O(训练 I/O):在模型训练期间,将海量数据集(如图像、文本、视频)从存储系统持续读取并馈送至 GPU 的过程。属于极高吞吐量的读取密集型工作负载,核心目标是消除 I/O 瓶颈,确保昂贵的 GPU 算力不被闲置。
Checkpointing(检查点保存):在分布式训练过程中,定期将数百 GB 乃至数 TB 的模型权重和优化器状态保存到存储介质中,用于故障恢复或断点续训。属于突发的并发写入密集型工作负载,要求存储系统具备极高的突发吸纳能力,以缩短训练暂停的时间。
KV Cache(键值缓存):大语言模型(LLM)推理时,用于保存注意力机制计算出的中间状态(Key 和 Value),以避免重复计算。当 GPU 显存不足而将 KV Cache 卸载到外部存储时,会产生极低延迟、高 IOPS 的小块随机读写工作负载。
Vector Database(向量数据库):用于管理和查询非结构化数据生成的高维向量嵌入(Embeddings),是 RAG(检索增强生成)架构的核心。其工作负载以**高并发的随机读取(KNN/ANN相似度搜索)**为主,对存储的延迟和元数据处理能力要求极高。

测试系统
Solidigm为AI存储打造了两种解决方案,我们测试了两者:PCIe Gen5 TLC SSD Solidigm D7-PS1010,专为性能和低延迟设计,以及PCIe Gen4 QLC SSD Solidigm D5-P5336 ——我们测试了61.44 TB型号,该系列单设备可容纳多达122 TB的AI数据集。

硬件同样简单:一台NewFW的裸金属(2×AMD EPYC 9655,192核心/384线程,377GB DDR5,Ubuntu 24.04),每块SSD通过PCIe直连到主机上——没有SAN、NAS、中间不经过任何网络节点。
以下成绩是系统级调优的成果,不是一张驱动器规格表 —— Solidigm 的企业级 SSD,加上 NewFW 在内核 VFS 与 XFS 层面的调优,缺一不可。所有工作负载测试均通过 NewFW 的 CWP 云工作负载平台下发测试任务,cwp-agent 插件在测试机上自动化运行 mlpstorage 测试套件,并实时监控和上报系统和硬盘各项数据指标,最后生成分析报告。正是通过 CWP 平台,我们得以积累大量测试数据和经验,通过分析不断优化,才最终交出一份满意的答卷。
测试结果
四个工作负载全部通过 MLCommons CLOSED类别验证:Training I/O、Checkpointing、KV Cache 在两块盘上均达标,Vector Database 在Solidigm D7-PS1010 上达标。
Training I/O(Unet3D)
Solidigm D7-PS1010以11.61 GiB/s的数据传输率,使模拟的B200加速器利用率保持在98%以上;Solidigm D5-P5336提供5.76 GiB/s的数据传输率,加速器利用率达到了97.7%的速度——对于一个为单个加速器提供数据驱动的存储设备来说,这是一个非常出色的成绩。

如何解读这些数字。每个模拟的B200理论上对存储的供给需求约6.3 GB/s,因此两个加速器加起来约12.7 GB/s——Solidigm D7-PS1010提供11.61 GiB/s(约12.5 GB/s),并且在连续五轮连续测试中,保持加速器利用率在98.4%。第三个B200将推高需求超过19 GB/s,超出单个PCIe Gen5 x4 NVMe SSD的性能——因此两个B200是(单块SSD)能够满足的最大配置。加速器利用率(Accelerator Utilization)是指模拟GPU计算而非等待存储的时间比例。作为基准测试的结论,要求 AU在连续五次验证运行中≥90%。
如何与我们的v2测试进行比较。图表将v3与我们测试的Solidigm D7-PS1030(6.4TB PCIe Gen5 TLC SSD,H100/A100配置文件)并列对比:
基准测试变得更严格,而不是SSD变慢。v3模拟运行的加速器为B200,v2 模拟的加速器为H100和A100。两代GPU性能差别较大,单卡数据供给需求不同。v2版本单卡平均数据需求较低,因此可并发GPU 数量较多,整体吞吐量更逼近 TLC PCIe 5.0 x 4 的带宽极限。
v3达到了提交级别。v2是内部工程测试的版本,v3是严格按照MLCommons CLOSED类别要求测试,提交到官网排行版上的版本,CLOSED类别要求使用固定参数,代码经过校验,符合MLCommons的验证,同时经过社区 Peer Review。
Checkpoint(Llama 3.1 8B)
Solidigm D7-PS1010 的检查点保存吞吐量达 8.64 GiB/s,恢复吞吐量达 13.00 GiB/s。相较于Solidigm D5-P5336,其保存与恢复性能分别提升 2.8 倍和 2.6 倍。该数据直观证明了 PCIe Gen5 TLC SSD 在解决 AI 基础架构中突发密集型写入瓶颈方面的核心优势。

拒绝水分的真实数据: 面对 105GB 的Llama3-8B 巨型文件,我们采用 8 进程高并发直写 NAND,接着清空系统缓存,并连续循环 10 次取整体表现,确保每一兆带宽都真实可靠。
为算力争分夺秒: 算力昂贵,检查点落盘的每一秒都在燃烧预算。通过 12 秒级的极致存档体验,我们帮助 AI 团队在漫长的训练周期中夺回数小时的有效 GPU 训练时间,显著拉升集群 ROI。
KV Cache(Llama 3.1 8B)

直击显存溢出痛点:Solidigm D7-PS1010 重新定义 KV Cache卸载极限
当 LLM 推理遭遇上下文溢出,KV Cache 卸载至 NVMe 会瞬间触发海量随机小块读写。在严格遵循封闭规则的极限压测中(GPU缓存归零,溢出字节完全由 SSD 承载),Solidigm D7-PS1010 展现了统治级的硬件底层性能。
三大极限测试场景(零 GPU 缓存配置):
场景 1:极限高压(8B 模型,200 并发用户) —— 彻底禁用 CPU 缓存,将最大的存储压力直接穿透至底层,测试 SSD的绝对抗压底线。
场景 2:吞吐标杆(8B 模型,100 并发用户) —— 引入 4GB CPU 缓冲缓解 I/O 碎片化。1,194 Tokens/s 的峰值宣发成绩即诞生于此。
场景 3:巨型模型(70B 模型,70 并发用户) —— KV Cache 规模激增 2.5 倍,转化为更少但更大块的读取操作,直击大规模模型落地的真实痛点。

核心性能突破:
吞吐飙升,延迟骤降:Solidigm D7-PS1010 稳健输出 1,194 Tokens/s,相比前代Solidigm D5-P5336(787 Tokens/s)吞吐量大幅跃升 52%。更具破坏力的是,长尾延迟被无情压缩至四分之一(P95延迟从 15.1 秒断崖式降至 3.7 秒),完美契合 LLM 推理对极致响应速度的渴求。
硬核跑满 PCIe Gen5 总线:
• 前端视角(左侧图表): 直观呈现业务端 Token 生成速率,反映真实的服务可用性。
• 底层视角(右侧图表): 在场景 1 和 3 的无 CPU 缓存极限下,Solidigm D7-PS1010 爆发出 14.5 GiB/s 与 14.3 GiB/s 的惊人吞吐量,直接触达 PCIe Gen5 x4 的物理带宽上限(对比Solidigm D5-P5336 仅为 8.0/7.4 GiB/s)。
向量数据库(1000万向量×1536维度,Milvus + DiskANN)
在极具挑战的向量检索(RAG、推荐系统)生产环境中,Solidigm D7-PS1010 展现出了卓越的底层 I/O 承载力与极端工况下的抗压底色。
低延迟与高并发的完美平衡
在严苛的 9ms(P95)超低延迟边界下,Solidigm D7-PS1010 强势输出 140.4 QPS 的高频查询能力。在极速响应的背后,SSD 持续吞吐输出在1.5 GiB/s 的随机小块读取,单次代表性运行即可从容吞吐 521 GB 的图索引流量,精准对标企业级 RAG 架构中高并发、碎片化的真实 I/O 潮汐。硬核解密:56.5%召回率背后的超额含金量
为何召回率不是 90%+?真实世界的数据自带“聚类”属性,能让近似匹配(ANN)轻松获得高分。但 MLPerf 采用了极度刁钻的纯合成数据集(1000 万个无聚类结构的均匀随机向量),向量间距几近相等,在数学原理上就限制了理论召回上限。面对这种“地狱级”难度,Solidigm D7-PS1010 依然跑出了 56.5% 的惊艳成绩,直接碾压 MLPerf CLOSED 严苛基准底线(recall@10 ≥ 10%)达 5 倍之多。SSD 替代高昂内存:DiskANN突破全内存 QPS 极限
MLPerf Storage v3.0 (Milvus 引擎,1000万个 1536 维向量)重点采用将图索引强绑定于 SSD 的 DiskANN 算法。其核心价值在于用高性价比的 SSD 取代昂贵内存:面对每次查询引发的海量随机小块读取。测试证明,在顶尖 PCIe Gen5 闪存加持下,基于 SSD 的 DiskANN 不仅大幅压降 TCO,更实现了与全内存 HNSW 相媲美甚至超越的 QPS,成为大模型向量搜索的终极存储底座。
标准化基准测试中的亮眼成绩绝非偶然。这源自全栈工程的深度打磨——从上层应用到底层 NAND 闪存的系统性架构优化,以及确保测试流程严丝合缝的自动化工具。

我们的方法论涵盖五个步骤:
设备准备:将驱动器格式化为最佳几何结构,并依据具体工作负载的 I/O 访问模式进行精准对齐。
文件系统调优:配置 XFS 文件系统实现分配与条带对齐,完美匹配 NVMe 设备特性,并通过定制挂载选项将元数据开销降至最低。
操作系统与内核调优:精细调校 Linux I/O 子系统以优化回写并压制延迟;严格遵循 CLOSED 规范在多轮运行间清空缓存,消除抖动污染,所有关键内核参数均经过严苛验证。
工作负载调优:在闭合固定的参数空间内精雕细琢,例如按标准规则精准配置 KV 缓存选项。
CLOSED验证与提交:锁定固定参数、执行多轮连续运行、完成校验和校验,最终通过 MLCommons 官方审核。
工程师的Tuning + NewFW CWP 自动化测试核心引擎自动化正是 NewFW 技术的杀手锏。我们的云工作负载平台(CWP)将每个基准测试打包成标准“配方”——这是对所有命令、参数和验证规则的版本化、可审计定义,让测试蜕变为“执行、观测、审查、调优”的持续闭环。这些测试配方由 CWP 代理一键下发至测试主机,实现全自动执行与实时监控。正是这套严密的自动化测试体系,让我们能够自信地向 MLCommons 呈交每一份经得起推敲的卓越成绩单。
对客户来说:您现在拥有可信、经独立验证的 AI 存储容量基准——源自业界最严苛的测试流程并完整公开披露。规划训练集群、设计检查点策略或部署推理服务时,您可以站在实测数据而非营销口径之上做决策。
对行业来说:单主机、单 SSD 的透明提交,为基准测试树立了新的诚信基准底线。无论客户、竞争对手还是研究人员,都能完整核查我们所用的硬件、调试方法与被测内容——这才是 NAND SSD 基准应有的样子:可验证,可复现,公开透明。
Solidigm是企业数据存储领域的领导者。凭借数十年的产品领导力和技术创新力,Solidigm正与客户携手推动业务转型,共同迈向以数据为中心的未来。Solidigm在打造创新产品和助力客户成功等领域处于长期领先地位,借助从核心数据中心到边缘的强大端到端产品,为AI等前沿领域的发展提供有力支持。Solidigm是 SK海力士的独立子公司,总部位于美国加州兰乔科尔多瓦,业务遍及全球。如欲了解有关 Solidigm 的更多信息,请访问[https://solidigm.com],或关注微信公众号[SolidigmChina]。
*文中涉及的其他名称及商标属于各自所有者资产
向上滑动阅览
∨ 本文提及的所有产品、计算机系统、日期和数据都是基于当前预期的初步设计,如有更改,恕不另行通知。
硬件、软件或配置上的差异会影响实际性能。
Solidigm对非Solidigm产品的优化可能无法达到对Solidigm编译器或其他产品的优化程度。
Solidigm技术可能需要启用硬件、软件或服务激活。
本文中的任何内容均不构成任何明示或默示的保证。
本文档中描述的产品可能会存在如“勘误表”类的设计缺陷或微小误差,这可能会导致实际规格偏离上文描述。最新情况可承索提供。
在不同情况下,您的成本和结果可能会不同。
© Solidigm. "Solidigm"是SK hynix NAND Product Solutions Corp (d/b/a Solidigm) 的商标。其他名称和品牌可能属于他方资产。

*文中涉及的其他名称及商标属于各自所有者资产
向上滑动阅览
本文提及的所有产品、计算机系统、日期和数据都是基于当前预期的初步设计,如有更改,恕不另行通知。
硬件、软件或配置上的差异会影响实际性能。
Solidigm对非Solidigm产品的优化可能无法达到对Solidigm编译器或其他产品的优化程度。
Solidigm技术可能需要启用硬件、软件或服务激活。
本文中的任何内容均不构成任何明示或默示的保证。
本文档中描述的产品可能会存在如“勘误表”类的设计缺陷或微小误差,这可能会导致实际规格偏离上文描述。最新情况可承索提供。
在不同情况下,您的成本和结果可能会不同。
© Solidigm. "Solidigm"是SK hynix NAND Product Solutions Corp (d/b/a Solidigm) 的商标。其他名称和品牌可能属于他方资产。


