新闻中心

新闻中心

新闻中心

新闻中心

亿万克大规模算力集群备份容灾解决方案

2026-07-30

12台全闪存+5台调度节点,亿万克如何用三层架构终结算力空转?

某AI大模型团队训练到第15天,一块硬盘故障导致3天进度归零——这不是个案。在GPU算力成本每分钟数千元的今天,容灾缺失正成为AI训练最大的'隐形杀手'。

随着企业AI业务规模化的落地,搭建一套高性能、高可靠的算力备份容灾体系,已从“可选”变为“刚需”。

三层架构,如何让存储不再拖后腿?

亿万克采用12台R822N6+全闪存服务器构建高速存储资源池,搭载NVMe U.2高速固态硬盘、25G高速网卡及200G HCA高速互联卡,打造低延迟、高吞吐的性能底座;同时配套5台R322N6+服务器用作管理调度层,负责数据状态监控、统一运维、灾备调度与故障自愈,实现大规模集群智能化管控。并采用三层立体分布式架构,兼顾性能与安全:

第一层:数据存储保护

高速全闪存存储层依托NVMe协议,提供极低的数据访问时延和极高的IOPS,适配海量数据高频并发读写,搭配全规格RAID,实现单机硬盘级数据冗余保护。

第二层:智能灾备调度

在硬件层面,通过集成的BMC芯片实现对全部服务器的远程集中监控、告警管理和固件升级;在软件层面,通过灾备管理软件制定备份策略、完成调度管理,实现设备统一管控。

第三层:算力集群对接

通过万兆/InfiniBand高速网络对接存储层和调度层算力集群,节点异常可备份数据、自动迁移任务、无缝切换,保障业务全程无中断、数据零丢失。


配图.jpg

图/亿万克全闪存R822N6+服务器

 

两大维度,算力容灾的真实收益

(1)全闪极致性能,大幅缓解算力空转

亿万克全闪存算力备份容灾解决方案基于端到端NVMe协议,有效提高读写性能,大幅降低数据读写延迟,完美匹配算力集群对存储性能的极致要求。

(2)三层容灾架构,规避算力集群风险

面对单盘损坏、节点异常、人工失误等各类突发情况,系统可自动感知故障、迁移任务并完成链路切换,减少人工干预,实现数据零丢失、业务不中断、训练不返工。

从“抢跑”到“稳跑”,底层性能稳定性与安全性同样是AI算力竞争的关键一环,亿万克全闪存算力备份容灾解决方案,以三层容灾架构守护大模型训练的运行连续性,为AI业务规模化发展保驾护航。