新闻资讯

让用户获得最佳数据存储体验
当前位置:首页>新闻资讯
AI 非结构化负载性能瓶颈如何破解?京存双控 NVMe 全闪共享存储成 AI 训练标配选型

一、AI 行业存储现存痛点深度拆解

文生视频、多模态大模型、自动驾驶视觉训练等 AI 业务的数据具备鲜明特征:数据主体为非结构化数据,同时存在两种极端负载:亿级 KB 级标注小样本、数十 GB 级别连续视频数据集;业务架构混合部署,既要多组 GPU 集群高速读取数据集训练,也要标注服务器、算法终端便捷访问素材。 传统存储架构落地 AI 场景普遍存在四大短板:

1.单控制器全闪存在单点故障风险,一旦存储宕机,正在进行的大模型训练任务直接中断报废,数日算力投入付诸东流;

2.普通分布式 NAS 承载海量小训练样本时,元数据节点极易形成性能瓶颈,样本读取缓慢拉长训练周期;

3.采用「本地盘 + 对象存储」分离架构存放数据集,形成多处数据孤岛,数据集版本混乱、同步耗时,运维成本翻倍;

4.GPU 与存储之间依靠 CPU 转发数据,产生额外时延开销,GPU 长期处于等待数据的空闲状态,算力利用率偏低。 如果采用两套存储分别承载训练、标注业务,不仅部署成本高,还会出现数据集多副本冗余、数据不一致等衍生问题。

二、京存双控 NVMe 全闪共享存储架构设计思路

2.双控 Active-Active 高可用架构

双控制器互为冗余、同时承接业务流量,任一控制器离线、升级维护时,业务流量毫秒级自动切换至对端控制器,上层 GPU 集群、标注服务器完全无感知。控制器、电源、风扇、前端业务网、后端硬盘网全部冗余配置,达成 99.99% 可用性,适配 AI 研发 7×24 不间断训练的业务模式。

2.NVMe 全闪存端到端硬件架构

后端硬盘全域 NVMe SSD 组网,后端带宽无瓶颈;前端业务网卡支持 25G/100G 高速组网,原生集成 RDMA 协议、GPU Direct 直通接口。 核心性能指标:聚合带宽最高 70GB/s,IOPS 突破百万,随机访问时延达到微秒级别。

3 统一共享多协议资源池

单台设备融合 NAS、SAN 双协议,构建统一高速闪存资源池:

1.GPU 训练集群通过 SAN 块通道 + RDMA 直连读取训练数据集,获取最低访问时延,最大化训练效率;

2.算法终端、数据标注工作站通过 NFS/SMB 挂载 NAS 命名空间,便捷完成样本查看、标注、筛选工作; 同一份视频、图像非结构化数据集仅留存一份,训练、标注两类业务可并行读取调用,彻底消除数据孤岛,节省存储容量与数据集同步的带宽开销。

三、从架构层面解决 AI 行业存储痛点

1.大幅提升 GPU 利用率 GPU Direct+RDMA 直通架构去掉 CPU 转发开销,GPU 无需空等数据加载,算力利用率由 65% 提升至 95%,同等算力规模下,模型训练周期缩短 20%~35%;

2.简化 AI 机房部署架构 一台双控 NVMe 全闪即可替代「高速本地盘 + NAS」两套存储架构,精简机房设备数量,降低运维复杂度;

3.零中断运维升级 依托双控冗余架构,扩容硬盘、升级固件全程不停业务,AI 研发团队无需暂停训练任务配合运维;

4.国产化底座适配 可选海光 / 飞腾国产化硬件版本,适配信创 AI 研究院、政务 AI 平台落地,满足数据底座自主可控的政策要求。

五、适配 AI 技术场景

1.AIGC 赛道:文生视频模型训练、AI 视频批量推理生成;

2.多模态 AI 研发:图文音视频混合数据集存储、跨模态大模型训练;

3.自动驾驶领域:路测视频数据入库、仿真模型迭代训练;

4.城市智慧视觉:海量监控视频接入 + AI 实时分析推理;

5.信创 AI 领域:政企自研私有化大模型数据集安全存储。


AI 视频生成、多模态大模型进入规模化量产阶段,混合形态的非结构化数据集,对存储的可靠性、访问时延、集群共享能力提出全新要求。 双控 NVMe 全闪共享存储凭借双控不间断架构、多协议共享、GPU 直通加速、大小文件混合负载优化四大特性,既能满足数据标注、算法人员便捷访问数据集的需求,又可为 GPU 训练集群提供低时延高速读写能力,是当前 AI 赛道高性能非结构化存储的优选方案。 京存坚持国产化自研路线,将该商用架构落地量产,可为国内 AI 实验室、AIGC 科创企业、自动驾驶研发机构提供自主可控的高性能数据集存储支撑体系。


服务热线:
010-62410836
  • 关注我们

  • 联系我们

  • Copyright © 2018-2025 北京智慧仓存储技术有限公司 All Rights Reserved. 京ICP备14024020号-1