再创全球 AI 存储性能记录丨焱融全闪 F9000X 斩获 MLPerf Storage v3.0 多项世界第一
北京时间 9 月 1 日晚,全球 AI 性能评测组织 MLCommons 正式发布 MLPerf Storage v3.0 基准测试结果。作为全球公认衡量 AI 存储实力的「黄金标准」,本轮测试新增 KVCache 推理缓存专项测试,扩展其对 AI 全场景工作负载的覆盖能力。焱融科技旗下全闪 AI 存储 F9000X 一体机交出亮眼成绩单,在 3D U‑Net 训练、Checkpoint 70B 断点续训等核心场景多项性能位居全球第一。继 v1.0、v2.0 蝉联冠军后,这家中国存储厂商用「三年三连冠」的硬核表现,向业界证明了其在 AI 基础设施领域的技术纵深。

(数据来源 MLPerf Storage 官方发布)
训练场景带宽近乎跑满,通用硬件环境刷新性能新高
在公认对存储吞吐量要求最苛刻的 3D U‑Net 模型训练测试中,焱融全闪 F9000X 三节点存储集群聚合带宽达到 544GiB/s。这一数字近乎将集群配置的高速网络带宽全部打满,毫无悬念地拿下该场景全球第一。而这也并非单纯堆砌硬件的「大力出奇迹」:每个 F9000X 节点仅采用 2U 通用 x86 服务器,搭载英特尔至强®6900P 处理器、PCIe Gen5 NVMe SSD 和 4 块 NVIDIA ConnectX‑7 400G 网卡,在标准硬件平台上实现了近乎极限的带宽利用率。

(数据来源 MLPerf Storage 官方发布)
「用更少的存储节点释放更强的数据供给能力」,正是焱融成绩背后的核心逻辑。对于 AI 训练集群而言,存储带宽往往成为 GPU 算力释放的瓶颈;而焱融全闪 F9000X 的极致带宽利用能力,意味着企业可以以更低的存储硬件成本支撑更大规模的算力集群,直接降低 AI 基础设施的 TCO。
Checkpoint 70B 读写双冠,保障模型高效断点续训
大模型训练动辄数周甚至数月,Checkpoint(断点存档)的读写速度直接影响训练效率。在 MLPerf Storage v3.0 的 Checkpoint 70B 测试中,焱融存储集群实现了 539GiB/s 的读带宽和 314GiB/s 的写带宽,读写性能均位居全球第一,双双刷新历届 MLPerf Storage 公开测试成绩最高水平。

(数据来源 MLPerf Storage 官方发布)
优异的断点读写性能,可极大缩短千亿级万亿级大模型训练的存档与恢复耗时,有效规避训练中断导致的算力浪费与时间损耗,显著提升大规模大模型训练的连续性与稳定性,全方位保障 AI 大模型高效训推的核心需求。对于 AI 研发团队来说,这一能力无疑是效率提升的关键利器。
从训练到推理,G3.5 共享缓存加速 Token 生产
伴随长上下文、高并发大模型推理需求爆发,KV Cache 已经成为推理性能的关键瓶颈,存储作为 KV Cache 第三层卸载介质的价值日益凸显。MLPerf Storage v3.0 首次加入 KVCache 评测,正是对这一产业趋势的回应。本次测试中,焱融全闪 F9000X 完成 KVCache 基准验证,实测读带宽 288GiB/s、写带宽 60GiB/s,验证存储承担 KV Cache 卸载与回读的能力。

此外,针对现有 G1-G4 KVCache 缓存分层逐渐面临容量有限、跨节点难共享、缓存复用效率不足等挑战,焱融科技推出了 YRCache ContextBox 一体机,构建 G3.5 专属共享缓存层,为 KV Cache 提供跨节点共享的高速上下文空间。结合焱融 YRCache 推理存储系统,实现 KV Cache 在不同存储层级间的统一管理、智能调度与高效流动,减少重复计算与 GPU 等待,高效支撑长上下文、高并发、Agent 推理及 Token 工厂等新型 AI 推理场景。
从 AI 训练数据高速供给、Checkpoint 读写,到面向推理场景的 KV Cache 管理,存储正在成为影响 GPU 利用率和 AI 基础设施整体效率的重要环节。焱融目前已形成由全闪存储 F9000X、YRCache 推理存储系统以及 DataInsight 数据管理平台组成的全栈 AI 存储产品体系,覆盖 AI 训练与推理过程中的多类数据工作负载。
焱融科技表示,未来将继续围绕算力、存力与网络协同,针对 AI 训练、推理及新型数据工作负载持续优化存储基础设施,以高性能、高效率的数据底座提升 GPU 算力利用效率,支撑 AI 应用规模化发展。
来源:互联网


首页




