新闻中心
新闻中心
新闻中心
某AI大模型团队训练到第15天,一块硬盘故障导致3天进度归零——这不是个案。在GPU算力成本每分钟数千元的今天,容灾缺失正成为AI训练最大的'隐形杀手'。
随着企业AI业务规模化的落地,搭建一套高性能、高可靠的算力备份容灾体系,已从“可选”变为“刚需”。
亿万克采用12台R822N6+全闪存服务器构建高速存储资源池,搭载NVMe U.2高速固态硬盘、25G高速网卡及200G HCA高速互联卡,打造低延迟、高吞吐的性能底座;同时配套5台R322N6+服务器用作管理调度层,负责数据状态监控、统一运维、灾备调度与故障自愈,实现大规模集群智能化管控。并采用三层立体分布式架构,兼顾性能与安全:
高速全闪存存储层依托NVMe协议,提供极低的数据访问时延和极高的IOPS,适配海量数据高频并发读写,搭配全规格RAID,实现单机硬盘级数据冗余保护。
在硬件层面,通过集成的BMC芯片实现对全部服务器的远程集中监控、告警管理和固件升级;在软件层面,通过灾备管理软件制定备份策略、完成调度管理,实现设备统一管控。
通过万兆/InfiniBand高速网络对接存储层和调度层算力集群,节点异常可备份数据、自动迁移任务、无缝切换,保障业务全程无中断、数据零丢失。

图/亿万克全闪存R822N6+服务器
亿万克全闪存算力备份容灾解决方案基于端到端NVMe协议,有效提高读写性能,大幅降低数据读写延迟,完美匹配算力集群对存储性能的极致要求。
面对单盘损坏、节点异常、人工失误等各类突发情况,系统可自动感知故障、迁移任务并完成链路切换,减少人工干预,实现数据零丢失、业务不中断、训练不返工。
从“抢跑”到“稳跑”,底层性能稳定性与安全性同样是AI算力竞争的关键一环,亿万克全闪存算力备份容灾解决方案,以三层容灾架构守护大模型训练的运行连续性,为AI业务规模化发展保驾护航。
版权所有:深圳市亿万克数据设备科技有限公司