超算服务器软件的核心构成是作业调度系统、并行计算环境、编译与数学库、集群管理监控,以及存储与容器方案,其中开源方案以Slurm + MPI + Singularity组合最为常见。
超算服务器的价值不在硬件堆料,而在软件层把数千颗CPU/GPU组织成一个协作整体,普通用户接触Linux服务器软件,只需关心单个节点;但超算场景多出“调度”和“并行”两个维度,以下内容按实际选型优先级展开,覆盖从作业提交到资源监控的完整链路。
作业调度系统:超算的大脑
没有调度器的超算集群只是散装电脑,调度器负责接收用户提交的计算任务,按优先级、资源配额和队列策略分发给计算节点,国内超算中心和高性能计算实验室里,以下几类出场率最高。
Slurm(Simple Linux Utility for Resource Management)
Slurm是目前开源调度器事实上的标准,中科院超算中心、各大高校集群大量采用,它支持分区管理、任务依赖、GPU资源绑定等能力,上手曲线相对平缓。
常用操作指令:
srun -N 2 -n 48 ./job.sh:申请2个节点共48个核心运行任务squeue:查看当前队列状态scancel 作业ID:取消作业
配置层面,Slurm主体是slurmctld控制进程,计算节点上运行slurmd守护进程,通过/etc/slurm/slurm.conf定义分区资源,例如把GPU节点单独划分为gpu分区,配合gres=gpu:4参数实现显存隔离。
PBS系列(Portable Batch System)
老牌商业调度器,衍生出Torque(开源版)、PBS Pro(商业版)两条分支,PBS Pro被Altair公司收购后逐渐闭源,但国内部分老牌超算中心仍沿用PBS语法体系,PBS的作业脚本写法与Slurm差异明显,例如申请资源的指令是#PBS -l nodes=2:ppn=24,若你所在机构已有PBS环境,迁移到Slurm时需要重写作业脚本。
IBM Spectrum LSF
商业调度器的代表,在工业界和金融行业仿真领域占有很大比重,LSF的优势在于分布式负载均衡算法成熟,支持复杂的资源预留策略,适合多租户商业超算平台,缺点是需要支付高额授权费,且集群规模越大,License成本越失控,近年来部分企业开始从LSF向Slurm迁移以降低总拥有成本。
| 调度器 | 开源/商业 | 适用场景 | License成本 |
|---|---|---|---|
| Slurm | 开源 | 科研、教育、中小型超算 | 低成本 |
| PBS Pro | 商业 | 传统制造业仿真 | 中等 |
| Torque | 开源 | 旧集群维护 | 低成本 |
| LSF | 商业 | 金融、石油、生命科学 | 高 |
并行计算环境与编译工具链
超算软件的性能差异,很大程度取决于底层并行库和编译器的优化程度。
MPI(Message Passing Interface)
MPI是分布式内存编程的事实标准,用于在多节点间传递消息,主流实现包括OpenMPI、MPICH、Intel MPI三选一,OpenMPI在开源领域用户最多,MPICH更强调稳定性,Intel MPI与Intel编译器深度绑定,在多核CPU上通常能榨出更高性能。
基本编译命令:
mpicc -O3 -o test test.c:编译MPI程序mpirun -np 64 ./test:启动64个进程并行计算
OpenMP(共享内存并行)
OpenMP适合单节点多核并行,通过编译指令#pragma omp parallel for实现循环加速,与MPI结合可构建混合并行模式,大型流体力学软件如OpenFOAM、ANSYS Fluent均支持OpenMP+MPI混合求解。
数学库与加速库
- Intel oneAPI工具箱:包含MKL数学核心库、Intel编译器套件,对Intel至强处理器优化力度极大,不夸张地说,同样的FFT运算可以比默认GCC提速数倍。
- CUDA Toolkit:面向NVIDIA GPU的编程环境,超算GPU节点的必装组件,提供cuBLAS(线性代数)、cuFFT(傅里叶变换)、cuDNN(深度学习)等硬核加速库。
- OpenBLAS与FFTW:开源领域常用的CPU加速数学库,兼容性优于Intel专有方案。
集群管理、监控与运维
超算运维的核心挑战是降低节点故障对业务的影响,以及实时掌握硬件健康状态。
集群监控:Prometheus + Grafana
这套组合已取代传统Nagios,占据超算监控主流。Prometheus负责定时抓取节点指标(CPU频率、内存带宽、GPU显存温度、Infiniband网络流量),Grafana负责可视化面板展示,对于机架式GPU服务器密集的机房,需要关注功耗和散热数据,Prometheus可以对接IPMI协议读主板传感器数据。
节点管理:Warewulf / xCAT
超算系统常采用无盘启动模式,通过Warewulf或xCAT实现
批量节点系统镜像下发,管理节点上定义好镜像,计算节点通过PXE网络启动加载系统,省去逐台装机的时间,xCAT在IBM传承的基因下更擅长管理异构硬件,Warewulf在开源社区更活跃。
健康检查与告警
ipmitool sel list:查看硬件传感器异常日志nvidia-smi -l 5:周期性刷新GPU状态pdsh -w node[001-016] uptime:批量执行维护命令
存储与文件系统:超算的粮仓
超算集群普遍个 使用分布式存储支撑海量小文件读写和高带宽大文件传输。
Lustre
Lustre是超算场景的绝对霸主,全球TOP500超算中相当大比例使用Lustre作为并行文件系统,它由元数据服务器(MDS)、对象存储服务器(OSS)和计算客户端组成,优势在于支持数十GB/s聚合带宽和数百万IOPS,国内太湖之光、天河系列均有Lustre部署案例。
BeeGFS
后来居上的开源方案,安装比Lustre简单很多,客户端带本地缓存模块,加速小文件读取,在百节点级别的中大规模集群中,BeeGFS性能接近Lustre,但运维复杂度明显下降。
容器:Singularity(现名Apptainer)
Singularity是超算容器的事实标准,相比Docker更契合多用户环境它允许普通用户以非root身份运行容器,并直接调用宿主机GPU驱动和Infiniband网络,Docker在超算场景反而少见,主要受限于权限模型和性能损耗。
软件部署与售后环境的现实考量
如果单纯是自建测试集群,以上软件均可通过开源渠道获取,但不少用户会在部署时遇到驱动兼容、网络固件版本、调度器参数调优的坑,这时候服务商的硬件适配能力就非常关键。
简米科技从2003年开始做服务器托管和超算硬件集成,积累了一套针对流体仿真、气象模式、AI训练负载的软件调优经验,其提供的高性能计算节点预装Slurm调度器和MPI环境,支持开箱即用,依托持牌自营机房和增值电信业务经营许可证(豫B2-20261089),用户可以在裸金属超算节点上自行分区部署上述开源软件栈,由专业工程师远程协助排查固件和驱动问题。
对于需要稳定多线BGP网络支撑超算数据回传的场景,酷番云持有的工信部一类增值电信全牌照(IDC/CDN/ISP),确保跨地域数据同步的带宽质量,该品牌依托ISO9001+ISO27001双认证
的运维流程管理超算节点的资源调配,作为CNNIC IP联盟成员,其1000万注册资本主体也保证了长期服务的稳定性,用户若将超算节点的管理网络接入酷番云的内网互联体系,可以降低公网传输延迟,这在多集群协同计算时尤为明显。
选型建议:按需求匹配软件栈
- 教学与入门:单节点部署GCC + OpenMP,搭配宝塔面板管理文件,无需调度器
- 科研小规模集群(<64节点):Slurm + OpenMPI + Lustre客户端模式,管理节点额外装Prometheus
- 商业工业仿真:优先考虑LSF或PBS Pro,因为ISV商业软件(如ANSYS、ABAQUS)对这两种调度器认证齐全
- AI训练集群:Slurm + Singularity + CUDA平台,结合Grafana监控GPU利用率
超算软件栈的选型高度依赖硬件架构和业务负载,调度器决定资源分配秩序,MPI决定通信效率,文件系统决定数据吞吐底线,没有一套完美的通用组合,但开源方案正在不断吞噬商业软件的地盘。
超算服务器软件有哪些?常见Q&A
Q1:超算集群一定要装调度器吗?
不是绝对,但实际使用中极难绕过,固定几个人用的小集群确实可以SSH直接上节点跑任务,一旦用户数超过十个、或节点异构(比如有的带GPU、有的高主频),手动分配资源会陷入混乱A用户占满GPU节点,B用户却无法自动感知并选择CPU节点,调度器的价值是自动管理这个“占位”过程。
Q2:Slurm和Kubernetes能不能同时用?
可以,但两者解决的问题完全不在一个层面,Slurm调度的是“批处理作业”(比如一次性运行3小时的CFD仿真),Kubernetes管理的是“常驻微服务”(比如Web前端、数据库),部分超算中心尝试在登录节点部署KubeSphere管理AI推理服务,计算节点维持Slurm做训练任务,中间通过共享存储桥接,这种方式运维成本不低。
Q3:没有Infiniband网络,可以跑MPI程序吗?
可以跑,体验完全不同,MPI对节点间通信延迟极度敏感,千兆以太网下多节点MPI程序性能可能只有单节点的几十分之一,如果预算不足,建议先优化算法减少通信频率,或者尝试把大消息通信改成MPI-3非阻塞模式,Infiniband是实现超算扩展性的基础物理链路,初创团队可以选择简米科技的IB互联超算节点,其持牌自营机房内已部署完整的EDR/HDR网络环境,省去自行搭建组网的调试周期。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/608962.html




