算力狂飙,存储却拖了后腿
十年间单 GPU 算力增长约 1000 倍,而单 SSD 性能仅增长约 90 倍。存储性能严重滞后于算力,GPU 大量时间空转等待数据,算力被白白浪费。
存储墙——AI 发展的核心绊脚石
AI 大模型的存储挑战
海量小文件
数以亿计训练数据文件导致元数据爆炸、IOPS 暴跌,元数据操作开销远超数据读写。
超高带宽
模型训练与推理需 TB 级吞吐,传统存储带宽成为瓶颈,GPU 长时间空转等待数据。
超低延迟
对话式 AI 常需先检索大量资料,存储响应越快体验越好,传统存储延迟难以满足。
数据生命周期
数据越来越多、扩容不易、越来越卡,长期保存与弹性扩容难以兼顾。
多协议冲突
多框架跨协议并发访问,需原子一致性,传统割裂架构难以承载。
容灾备份
传统备份无法满足 RPO<15 分钟要求,训练中断后难以快速恢复。
传统存储的痛点
性能瓶颈:GPU 喂不饱
带宽/IOPS 不足、时延过高,GPU 60%–70% 时间空闲等待,算力严重浪费。
元数据风暴:海量小文件灾难
元数据操作开销远超数据读写,集中式元数据服务器成为单点瓶颈。
协议割裂:数据孤岛
块、文件、对象相互孤立,数据反复迁移、重复存储,浪费空间与带宽。
成本失控:TCO 失衡
介质价格暴涨,容量从 PB 迈向 EB,存储成本增速远超算力。
稳定性挑战:高可靠要求
训练耗时数天至数月,存储宕机将前功尽弃;推理场景要求零中断。
运维难题:人工运维难以为继
系统规模庞大、架构复杂,依赖人工运维效率低下且易出错。
为 AI 而生的卓越性能
原生底层存储引擎专为 AI、高性能仿真等高并发负载设计,稳定实现亿级随机 IO、TB/s 聚合吞吐、十微秒级访问延迟。
cStor 核心性能指标
去中心化全对称分布式架构
去中心化全对称架构
无中心管控节点,所有节点算力、IO、元数据处理完全对等,无单点瓶颈与故障,集群越大性能越强。
越扩越强,线性增长
性能与容量随节点增加近乎线性增长,千节点大规模集群仍稳定输出满配性能,传统存储扩容后大幅衰减。
自研版本化存储引擎
针对全闪优化日志写入与小文件元数据,内置多级智能缓存与 AI 访问预判,海量文件场景性能不衰减。
智能分层存储架构
热存储:DDR + SSD/SCM 持久内存
依托 DDR/SCM 低延迟特性构建高速缓存层,内存语义访问实现微秒级响应,非易失特性保障数据持久化。
冷存储:NVMe SSD/HDD
高并发协议栈实现高吞吐冷数据存储,条带化技术充分发挥多通道并行 I/O 能力,热数据自动下沉、冷数据自动归档。
自动调度,无需人工干预
系统按访问热度自动分层,避免反复从低速硬盘拉取数据,大幅削减等待耗时,性能显著提升。
用户态内核旁路 I/O 路径
SPDK + PMDK(本地)
绕过操作系统内核层,消除上下文切换开销,直接硬件管控 NVMe SSD 与持久内存 SCM,大幅降低 I/O 延迟。
RDMA 高速互联(节点间)
内存直达零拷贝,无需 TCP 转发,网卡 RDMA 支持 100Gbps+ 带宽,实现微秒级跨节点延迟。
数据直达,去除中间环节
从客户端到硬盘全链路低时延传输,网络与磁盘 IO 资源利用率大幅提升。
全异步流水线 I/O
全链路异步非阻塞
读写、迁移、校验、修复各类任务并行运转互不牵制,CPU 下发任务后无需原地等待,可立即承接其他业务。
小 IO 自动合并批量处理
零散小 IO 请求自动合并批量处理,支持专用硬件加速,百万文件读写同时进行无需排队。
性能测试集群配置
| 维度 | 规格 | 说明 |
|---|---|---|
| 节点数 | 60 | 6 个机架 × 10 节点/机架 |
| CPU | 鲲鹏 920-5220 (64 核 2.6GHz) | 华为 TaiShan 2280 V2 服务器 |
| 内存/节点 | 512 GB (16×32GB DDR4-2933) | 长鑫存储 RDIMM,8 通道 |
| NVMe/节点 | 32 块 × 7.68 TB | 忆恒创源 PBlaze6 7540 U.2 |
| 总盘数 | 1,920 块 | 全 NVMe,无 HDD/SSD 混合 |
| 总裸容量 | 14,745.6 TB (14.7 PB) | 实际可用取决于冗余模式 |
| 网络 | 华为 Hi1823 200Gb RDMA | RoCEv2,MTU 9000,双端口 |
| 集群总带宽 | 3,000 GB/s (理论峰值) | 60 节点 × 50 GB/s |
文件系统性能
FIO 4K 随机读 1.75 亿 IOPS、IOR 顺序读 14.1 Tbps——60 节点全闪集群实测。
延迟分布
60 节点全闪集群 4K 随机读实测:P50 约 8μs、平均约 10μs,长尾延迟受控,GPU 算力不再空转等待数据。
数据不丢,业务不停
从介质、节点、链路、校验到异地,五级冗余叠加无损快照与全方位安全防护,可靠性显著提升,无需担心数据丢失。
五级冗余数据保护机制
分布式介质容错
多副本 + EC 纠删码双模式,单盘故障业务不中断,灵活平衡空间利用率与读写性能。
节点级冗余
SWIM 故障检测,后台自愈重建,用户全程无感知,故障切换秒级完成。
网络链路冗余
多网卡 Bonding、双活链路,故障自动切换,避免网络单点失效。
端到端完整性校验
CRC32 + SHA256 双重哈希,数据损坏自动修复,保障全链路数据一致。
跨机房异地灾备
原生异地复制,RPO 可控的跨地域数据备份,满足 RPO<15 分钟要求。
高效无损快照机制
秒级快照,只存改动
依托统一版本机制秒级生成快照,多份快照共享不变数据只存改动,不浪费容量。
回滚克隆,业务不拖慢
快照回滚、克隆复用一气呵成,历史快照查询与业务读写互不干扰,闲置空间后台自动回收。
全方位数据安全防护
传输链路加密
RDMA/TLS/SSL 全链路加密,校验报文完整性,拦截篡改攻击。
端到端防篡改
全链路双重哈希校验,数据篡改直接拦截并告警。
身份接入认证
客户端必须合法凭证接入,无认证设备禁止访问。
细粒度 ACL 权限
池、容器双层权限管控,区分只读/读写/管理账号,业务数据隔离。
全量审计 + 异常识别
审计全部文件改写、删除、重命名操作,拦截勒索病毒大规模覆盖操作。
事务崩溃一致性
写入事务要么完整落地、要么全部回滚,断电/宕机不会产生损坏、半写数据。
故障不用人处理,一套存储承载多样业务
AI 全自动运维让故障自愈、告警降噪;多协议融合服务让一套底座兼容多种标准协议,数据无需来回迁移。
AI 全自动运维
主动预测式故障自愈
时序算法实时分析数百项硬件/IO 指标,提前预判老化与退化,自动迁移、隔离、重建,人工运维降低 90%+。
RCA 根因 + 可视化平台
RCA 根因引擎从告警风暴中找到真正源头并消除噪声,事前预警、事中处置、事后追溯,运维不再被海量告警淹没。
现场实测可视化运维
内置标准化测试工具与双语可视化管理面板,实时展示时延分位、集群吞吐,所有指标可现场实操核验。
多协议融合服务
统一多协议原生兼容
单池融合 POSIX、NFS、CIFS、S3、iSCSI、HDFS 等八大协议,原生 POSIX 无需网关,老系统不改代码直接挂载。
四层接口生态
原生高性能接口、并行文件系统兼容、大数据/AI 生态适配、标准化通用接口——覆盖 HPC、AI、大数据与通用业务,同时支持通用 S3 与 Python 开发接口。
四类接口,一套存储打通全生态
为高性能场景而生
面向对存储性能有很高要求的场景:大模型训练与推理、高频交易、高清视频、工业仿真、自动驾驶、医疗影像、低空经济。
大模型训练、推理场景
需求分析
推理服务对延迟极度敏感:首 token 响应、高并发请求下需稳定保持十微秒级时延;推理高频读取模型权重、KV 缓存、向量库等海量小文件与大文件,要求高 IOPS 与高带宽并存;推理通常 7×24 在线,任何中断都直接影响业务收入,需零中断高可用;多模型、多租户并发推理,还需负载隔离与弹性吞吐。
解决方案
全闪分布式存储 + 用户态内核旁路 I/O 路径,提供十微秒级延迟与亿级 IOPS,直击推理低延迟高并发痛点;RoCE 高速网络与聚合 TB/s 吞吐,加速模型权重与向量库加载;全对称无中心架构结合多副本与纠删码,自动故障切换与数据重建,保障推理服务零中断;多协议融合(POSIX / S3 / 对象)支持主流推理框架直连,智能调度隔离多租户负载,按需弹性扩缩。
其它典型场景
高频交易
百万级 IOPS、微秒稳定延迟,交易指令零丢失。
高清视频
200+ 轨道实时非线性编辑,帧级同步。
工业仿真
单节点承载 5000+ 并发仿真任务。
自动驾驶
200Gbps 高吞吐,千路传感器数据流实时处理。
医疗影像
PB 级 PACS 秒级检索,原生 DICOM,三维实时渲染。
低空经济
实时存储无人机回传的海量数据。
政企 / 超算数据中心
信创可选、稳定免运维,适配长期关键业务运行。
与传统存储 TCO 对比
南京云创智能科技有限公司
研发负责人介绍
为 AI 时代打造自主可控的存储底座
南京云创智能科技有限公司成立于 2020 年,脱胎于 2011 年成立的南京云创存储科技有限公司,主打自研超高速存储系统产品,通过代理体系推广。cStor 由同一团队在上一代存储产品十余年技术积累之上全新研发,面向 AI 时代打造。
刘鹏 教授 · 创始人 / 首席科学家
清华大学计算机博士、特等奖学金获得者,博士论文为高容错高性能存储系统;2002 年 Pennyort 世界冠军(中国第一位大数据冠军),2003 年全国挑战杯总冠军(RAID-M 存储系统)。中国电子学会云计算专委会云存储组组长、中国大数据应用联盟人工智能专委会主任、中国信息协会人工智能教育专家组长。
国家专利
软件著作权
兼容性认证
全面适配信创技术栈,支持飞腾、鲲鹏、龙芯、海光等国产 CPU 架构,以及麒麟、统信等国产操作系统;同时兼容主流通用硬件平台,可按需选配国产或通用方案。已完成飞腾、华为、鲲鹏、海光等国产 CPU 与麒麟、统信等国产操作系统互认证。
超大规模部署,坚如磐石
团队上一代存储产品已在公安警务云、智慧城市、国家超算中心、国家重点实验室、中科院卫星数据中心、运营商与众多高校智算平台落地,其中一套系统存储上万亿个文件、稳定运行 11 年无故障;cStor 由同一团队全新研发,面向 AI 时代坚如磐石。