2026年8月,中国大科学装置迎来密集上新期。其中最具代表性的是曙光8000十万卡AI超集群的正式上线,以及复旦大学在量子闪存(Quantum Flash)存储技术上的重要突破。这两项成果分别代表了经典超算和量子计算两个方向的最高水平,共同勾勒出中国超算基础设施的新高度。
十万卡AI超集群的技术规格
曙光8000AI超集群的核心计算单元由十万张高性能AI加速卡组成。这里的"卡"指的是专为AI训练和推理设计的GPU或ASIC加速卡,每张卡配备独立的高带宽内存(HBM)和CUDA兼容的计算核心。
从算力规格来看,整个集群的峰值算力超过10 EFLOPS(百亿亿次浮点运算/秒),即在FP16精度下的理论计算能力达到每秒100亿亿次浮点运算。这个量级意味着集群可以在数小时内完成一个大语言模型的全量训练,而传统超算需要数周时间。
集群的总内存容量约为50PB,其中HBM全局内存约占5PB,NVMe SSD存储池占45PB。如此庞大的内存规模对于支撑千亿参数模型的显存需求至关重要——单个十万卡集群可以容纳数十个百亿参数模型的同时训练。
网络拓扑架构
十万卡规模的集群面临的最大技术挑战是节点间的通信效率。在分布式训练中,梯度同步和数据集分片的通信开销往往占总训练时间的30%-50%,因此集群网络的设计直接决定了整体训练效率。
曙光8000采用了多层级的网络拓扑结构:
计算节点内部网络
每个计算节点内部,加速卡之间通过NVLink或类似的高速互联总线连接,提供每秒900GB以上的双向带宽。这是同一节点内多卡通信的主干网络,主要承载数据并行训练时的梯度聚合和激活值同步。
机架级网络
同一机架内的计算节点通过 InfiniBand NDR(400Gbps)或更高速率的交换架构互联。机架级网络的延迟控制在1微秒以内,带宽支持每端口800Gbps。这一层网络主要负责数据并行任务的节点间通信。
集群级网络
跨机架的大规模通信通过无阻塞的Fat-Tree拓扑实现,网络总带宽达到数十Pbps。关键在于,曙光8000的集群网络采用了"计算-通信重叠"(Compute-Communication Overlap)机制,利用GPUDirect RDMA技术,使得加速卡可以直接与网络适配器通信,绕过了CPU的介入,大幅降低了通信延迟。
此外,集群还支持跨机房的光纤互联,理论传输距离可达数百公里,为未来构建更大规模的联邦学习集群奠定了基础。
存储系统架构
对于十万卡集群而言,数据吞吐量是另一个关键瓶颈。一次完整的模型训练需要读取数百TB的训练数据集,并在训练过程中频繁写入检查点。曙光8000的存储系统采用了三层架构:
缓存层:基于DRAM的内存文件系统,将热点数据常驻于内存中,提供纳秒级访问延迟。
并行文件系统层:采用 Lustre 或 BeeGFS 等并行文件系统,总带宽超过1TB/s。每一块NVMe SSD均挂载至独立的存储节点,通过并行I/O实现高吞吐。
对象存储层:基于Ceph构建的S3兼容对象存储,用于长期数据归档和模型版本管理,总容量超过1EB。
特别值得注意的是,曙光8000引入了"数据预取+预测性加载"的智能调度机制。训练任务启动前,调度器会根据模型架构和训练数据特征,预先将数据加载到缓存层,并在训练过程中动态调整预取策略,使得存储I/O成为训练链路中几乎不成为瓶颈的环节。
能效设计
算力规模的扩大必然带来能耗挑战。十万卡集群的峰值功耗约为3-5MW,相当于数万个家庭的用电总量。曙光8000在能效设计方面采用了多项创新技术。
液冷技术是核心手段。集群采用浸没式液冷方案,将所有计算节点完全浸没在绝缘冷却液中,通过液-气热交换实现高效散热。相比传统风冷,液冷方案可将PUE(电源使用效率)降至1.1以下,意味着只有不到10%的电力消耗在冷却系统上。
此外,集群还引入了动态功耗管理策略:根据当前的训练任务负载,智能调节加速卡的频率和电压;在非高峰时段,将闲置的计算节点切换到低功耗待机状态。
复旦量子闪存的突破意义
与此同时,复旦大学在量子闪存(Quantum Flash)存储技术上的突破,为超算基础设施带来了新的可能性。量子闪存是一种基于量子点(Quantum Dot)的新型非易失性存储器,其核心优势在于:
超高密度:量子点的尺寸可以达到纳米级别,使得存储单元的密度远超传统闪存。理论存储密度可达当前NAND闪存的10倍以上。
超低功耗:量子点存储器的读写操作基于电子隧穿效应,能耗远低于传统闪存的电荷注入/弹出机制。
超长寿命:由于不存在传统闪存的氧化层退化问题,量子闪存的擦写寿命理论上可达10^12次以上,远超当前高端SSD的10^5次量级。
如果量子闪存技术能够顺利产业化,未来超算集群的存储系统将在密度、速度和寿命三个维度上实现质的飞跃。曙光8000已经为量子闪存的集成预留了接口和架构空间,待技术成熟后将立即部署。
产业化与应用前景
曙光8000十万卡AI超集群的应用场景覆盖多个领域:
大模型训练:支撑千亿参数语言模型、多模态大模型的全量训练,训练时间从数周缩短至数天。
科学计算:在气候模拟、生物医药分子动力学、材料计算等科学计算领域,提供前所未有的并行计算能力。
自动驾驶:支撑大规模车载数据分析和端到端自动驾驶模型的训练。
工业仿真:在汽车碰撞、航空气动、半导体制造等工业仿真场景,将单次仿真时间从数天压缩到数小时。
总结
曙光8000十万卡AI超集群的上线,标志着中国超算基础设施进入了EFLOPS级别的新纪元。通过网络拓扑优化、存储系统创新、液冷能效设计等多个维度的技术突破,曙光8000不仅实现了对国际领先水平的追赶,更在部分领域形成了差异化优势。加上复旦量子闪存的突破,中国在超算基础设施领域的布局正在从"硬件堆叠"向"系统集成创新"转型,为未来十年的AI和科学计算发展奠定了坚实基础。