查看服务器磁盘阵列的核心在于通过RAID管理工具或系统命令获取阵列状态、磁盘健康及配置信息,不同硬件厂商和操作系统有各自对应的工具。
服务器查看磁盘阵列命令有哪些?
无论你用的是Linux还是Windows,查看磁盘阵列的第一步是确认硬件类型,软件RAID通常通过操作系统命令管理,而硬件RAID则依赖厂商提供的专用工具,以下按场景列出最常用的命令,你可以直接复制到终端执行。
Linux软件RAID命令
Linux环境下,软件RAID多由mdadm管理,常用命令包括:
- 查看所有阵列的概要信息:
cat /proc/mdstat输出中会显示阵列级别、活动磁盘数量以及重建进度。 - 查看指定阵列的详细状态:
mdadm --detail /dev/md0显示阵列的UUID、磁盘成员、每个盘的状态(Active Sync/Spare/Faulty)等。 - 检查磁盘上的RAID元数据:
mdadm --examine /dev/sda用于确认磁盘是否属于某个阵列,以及其在阵列中的角色。
使用软件RAID时,你也可以通过smartctl -a /dev/sda来检查每块磁盘的SMART健康值,提前发现潜在故障。
硬件RAID命令(按厂商)
硬件RAID的命令因控制器品牌而异,但大部分主流厂商都提供CLI工具,下面是几个常见品牌的命令示例:
-
Dell PERC(基于LSI芯片)
Dell推荐使用MegaCli64或较新的storcli64。- 查看所有虚拟磁盘(逻辑卷)状态:
MegaCli64 -LDInfo -Lall -aALL - 查看所有物理磁盘信息:
MegaCli64 -PDList -aALL - 快速定位物理磁盘位置:
MegaCli64 -pdlocate -physdrv[32:0] -aALL(会闪烁对应磁盘的指示灯)
- 查看所有虚拟磁盘(逻辑卷)状态:
-
HP Smart Array
HP服务器通常使用hpssacli(较新系统可用ssacli)。- 查看所有控制器配置:
hpssacli cmd ctrl all show config - 查看控制器状态:
hpssacli cmd ctrl all show status - 查看特定逻辑驱动器详情:
hpssacli cmd ctrl slot=0 ld 1 show
- 查看所有控制器配置:
-
LSI/Avago/Broadcom
LSI芯片的通用工具是storcli。- 查看控制器0信息:
storcli64 /c0 show - 查看所有物理磁盘:
storcli64 /c0 /eall /sall show - 查看事件日志:
storcli64 /c0 show events
- 查看控制器0信息:
-
华为FusionServer
华为服务器常使用IPMI工具或自己的管理软件,但底层RAID命令仍可透过storcli或MegaCli操作,具体视RAID卡型号而定。
Windows系统下的查看方法
Windows没有原生命令行可以查看硬件RAID状态,但可以借助图形化工具或厂商管理软件。
- 磁盘管理(diskmgmt.msc):只能看到磁盘是否在线,无法判断RAID级别和健康状态。
- 厂商管理工具:如Dell的OpenManage Server Administrator(OMSA)、HP的Systems Insight Manager(SIM)、LSI的MSM等,均提供详细的阵列视图。
- 命令行:部分厂商提供类似
MegaCli64.exe的Windows版本,用法与Linux一致。
如果你需要批量管理多台服务器,建议优先使用storcli或MegaCli这类跨平台CLI工具,方便脚本化检查。
服务器磁盘阵列状态怎么看?
拿到命令输出后,关键是要读懂状态参数,不同厂商的术语略有差异,但核心含义类似,下表总结了最常见的状态及对应处理方式:
| 状态术语 | 含义 | 运维建议 |
|---|---|---|
| Optimal / Good / Online | 所有磁盘正常,阵列运行在最佳状态 | 无需操作,按计划巡检即可 |
| Degraded | 阵列中有一块磁盘故障,失去冗余能力,但数据仍可访问 | 立即更换故障盘,启动重建;若热备盘已自动激活,需确认重建进度 |
| Failed / Offline | 阵列无法正常使用,或磁盘未被控制器识别 | 先检查物理连接(线缆、背板),再尝试修复或重建;若多盘故障,数据恢复难度大,需从备份恢复 |
| Predictive Failure | 磁盘SMART预警,即将出现故障 | 尽快更换该盘,避免阵列降级 |
识别重建进度
当阵列处于降级并正在重建时,多数工具会显示重建百分比,MegaCli输出中会包含Rebuild Progress: 30% complete,你可以通过以下命令查看重建进度:
- Dell/CLI:
MegaCli64 -LDReconRate -Show -Lall -aALL - HP/CLI
:
hpssacli cmd ctrl slot=0 ld 1 show输出中会包含Rebuild Status字段 - storcli:
storcli64 /c0 /v0 show中的State字段会显示Rbl状态
检查热备盘状态
热备盘(Hot Spare)的状态也需要关注,如果热备盘已经激活并顶替了故障盘,阵列状态会从Degraded逐渐恢复为Optimal,但热备盘本身的状态会变为In Use或Active Spare,建议定期确认热备盘数量是否充足,以及是否被正确分配。
服务器磁盘阵列巡检步骤
将阵列检查纳入日常巡检,是预防意外宕机的有效手段,以下步骤你可以直接用于运维手册,其中包含了服务器raid阵列检查步骤。
每日检查项
- 查看阵列状态:执行上述命令,确认所有阵列不为Degraded或Failed。
- 检查物理磁盘状态:确认所有磁盘显示为Online或Good,没有Faulty或Bad。
- 快速查看日志摘要:用
MegaCli64 -AdpEventLog -GetEvents -f events.log -aALL或storcli64 /c0 show events筛选最近24小时的错误记录。
每周检查项
- 执行一致性检查:硬件RAID卡通常支持自动一致性检查,但建议每周手动触发一次,确保数据奇偶校验正确,命令示例:
MegaCli64 -LDCC -Start -Lall -aALL - 检查SMART状态:对每块磁盘执行
smartctl -a /dev/sdX,重点关注Reallocated_Sector_Ct和Pending_Sector计数,若数值持续增长,应考虑更换。
每月检查项
- 更新固件和驱动:登录厂商官网,查看RAID卡固件是否有安全修复或性能优化,在维护窗口内升级。
- 备份配置:导出RAID卡配置,以便在更换控制器时快速恢复,命令:
MegaCli64 -CfgSave -aALL -f config.txt
服务器硬盘阵列检测工具对比
选择工具时,主要考虑操作系统兼容性、输出可读性以及是否支持远程管理,以下对比可以帮助你根据场景做出选择。
| 工具 | 适用平台 | 优点 | 缺点 |
|---|---|---|---|
| MegaCli64 | Linux/Windows | 功能全面,Dell/LSI卡通用,支持脚本化 | 命令参数较多,学习曲线陡峭 |
| storcli64 | Linux/Windows | 语法更简洁,输出更清晰,新一代工具 | 部分旧卡不支持 |
| hpssacli/ssacli | Linux/Windows | HP/ProLiant专用,与iLO集成良好 | 仅限HP硬件 |
| OMSA | Windows/Linux | 图形化界面,直观易用,适合新手 | 占用系统资源,需安装额外服务 |
| mdadm | Linux | 原生支持,无需额外安装,社区资源丰富 | 无法管理硬件RAID,功能有限 |
如果你需要同时在多台服务器上巡检,storcli64和MegaCli64是最佳选择,因为它们可以轻松嵌入脚本,行业共识认为,storcli64正在逐步取代MegaCli,建议新部署的服务器优先使用storcli。
服务器查看磁盘阵列常见问题
为什么执行MegaCli提示找不到命令?
MegaCli需要手动安装,你可以从Dell或Broadcom官网下载对应操作系统的安装包,安装后确保其路径(通常为/opt/MegaRAID/MegaCli/)被加入PATH环境变量,如果不想安装,可以尝试使用storcli,它通常被集成在最新的RAID卡驱动中,且安装包更小。
软件RAID和硬件RAID的查看方法有何不同?
软件RAID(如mdadm)完全依赖操作系统,命令通用,但无法提供硬件层面的健康信息(如缓存电池状态、风扇转速),硬件RAID有独立控制器,厂商工具能报告更底层的状态,包括控制器温度、重建进度、缓存策略等,在性能监控和故障预警方面,硬件RAID的可观测性更强。
阵列报警时如何快速定位故障盘?
先通过命令获取故障盘的Enclosure ID和Slot Number,以MegaCli为例,执行MegaCli64 -pdlist -aALL | grep -E "Enclosure|Slot",记录故障盘的编号,然后执行MegaCli64 -pdlocate -physdrv[E:S] -aALL,该命令会点亮对应磁盘的定位指示灯,方便你在机房中直接拔盘更换,如果使用storcli,命令为storcli64 /c0 /eE /sS start locate。
定期查看服务器磁盘阵列状态并掌握正确的命令操作,是保障业务连续性的基本功,建议运维人员将阵列检查纳入日常巡检清单。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/513174.html



