联想SR658服务器指示灯闪烁,本质上是BMC(基板管理控制器)把硬件状态翻译成视觉信号的过程,灯闪并不一定代表设备要报废,多数情况下它只是向你传递一条具体的预警信息,处理思路很简单:先看颜色和位置,再读前面板诊断代码,最后登录BMC查SEL日志,三步就能锁定问题方向。
联想sr658服务器故障灯亮怎么处理?先分清三种指示灯再说
很多朋友一看到服务器面板上某个灯在闪,心里就咯噔一下,觉得是机器要罢工了,其实联想SR658前面板上的LED灯少说有七八个,每个灯都有自己的脾气,故障处理的第一步不是拆机,而是搞清楚是哪个位置的灯在闪。
前面板系统状态LED:蓝色正常、黄色警告、红色故障
这一颗灯是大家最容易混淆的。系统状态LED在正常运转时是常亮的蓝色,如果出现黄色闪烁,说明系统检测到了预测性故障,什么叫预测性故障?比如硬盘的SMART信息里出现坏道增长、CPU温度越过了警告阈值、风扇转速出现轻微波动,这些情况还没让系统当机,但BMC已经记了一笔账,如果是红色闪烁,那就是实实在在的故障状态,比如内存训练失败、CPU供电异常。
硬盘LED:绿色在闪是好事,橙色在闪要留意
硬盘托架上的LED是最容易让运维人员误判的。绿色闪烁代表硬盘正在读写,这是正常的工作状态,但如果这块硬盘的LED变成了橙色闪烁,说明该盘所在的RAID阵列处于降级状态,或者硬盘本身有预测性故障,行业共识认为,橙色闪灯的硬盘在一周内掉线的概率相当大,建议尽快规划替换窗口。
网络LED:别把数据流量当成故障
前面板网口的LED快速闪动,很多人会以为是报错,实际上那是网络活动指示灯,数据吞吐量大时闪得快,平时闪得慢。如果网口LED完全不亮,反而才是链路断开的信号。
联想sr658警告灯黄色闪烁,先从诊断面板读代码
当系统状态LED出现黄色闪烁时,下一步动作非常关键:看前面板的诊断指示灯面板(一个小的两位数码管区域,通常位于硬盘托架右侧或机箱把手附近),这个面板会直接显示两位数字或字母代码,它比任何灯都更诚实。
按一下“显示信息”按钮,切换代码模式
如果诊断面板没有显示内容,先按一下旁边的显示信息按钮(Display Information button),系统会切换显示模式,把当前的错误代码显示出来,举个例子,如果你看到类似“1U”或者两位数字的代码,记录下来,这个代码的含义在Lenovo XClarity Provisioning Manager界面里会有对应的文字描述。
登录XClarity Controller,看SEL事件日志
诊断面板给的是一个快照,真正的细节在SEL(System Event Log)里,操作路径如下:
- 用网线连接服务器的管理网口(RJ45管理接口,一般和业务网口分开,旁边有扳手小图标)
- 在浏览器输入BMC的IP地址(如果没有改过,可以在开机自检时按F1进UEFI设置里查看,或者在DHCP服务器里找一下)
- 进入登录界面,用管理员账号登录
- 左侧菜单找到BMC日志或事件日志(不同固件版本叫法略有差异),点进去查看最新条目
这里重点看几条信息:事件ID、组件名称、严重级别,你会发现黄色闪烁对应的条目一般是“Warning”级别,很少直接出现“Critical”,看到“Critical”才需要立刻处理。
硬盘指示灯橙色闪烁,多半是RAID阵列在求助
前面提到硬盘灯橙色闪烁的含义,这里展开说说实际运维中见到最多的场景,联想SR658默认配置的硬盘方案通常是ThinkSystem RAID 930系列阵列卡,配合SAS或SATA硬盘,当阵列中某块盘出现性能波动或者链路错误,阵列卡会把这块盘标记为“Predictive Fail”,对应的硬盘指示灯就会开始橙色闪烁。
具体操作:先判断能不能补,再决定怎么换
- 登录阵列卡管理界面(重启服务器按Ctrl+H进入,或者用MegaRAID Storage Manager软件)
- 查看虚拟磁盘状态,如果显示“Degraded”,说明已经有盘掉线了
- 如果显示“Optimal”但某块盘的状态是“Predictive Fail”,说明暂时还能扛,但要抓紧时间备份数据
- 更换硬盘时,直接在服务器面板上抽出对应槽位的硬盘托架,插入一块同样转速和容量的新盘,阵列卡会自动开始重建,这个过程会有新盘的LED快速闪绿光,别紧张,那是重建的数据活动信号
业内专家指出,多数RAID阵列的降级事故都起源于硬盘的SMART警告被忽视,橙色闪灯其实就是系统在给你打预防针当你看到两块以上的硬盘同时闪橙灯,阵列可能已经处在崩溃边缘了,大概率要立即停机检修。
别忽略电源模块上的警告灯
联想SR658是双电源冗余设计,如果某个电源模块的LED出现黄色闪动或者直接熄灭,说明该电源有问题。断电重启解决不了电源硬件问题,遇到这种情况,建议先看BMC里读取的电源电压和温度读数,如果数值明显偏离正常范围,就准备联系备件渠道更换模块。
用BMC事件日志判断闪烁原因,比拆机更靠谱
指示灯只是表象,真正能还原事故现场的是日志,联想SR658的BMC支持标准的IPMI协议,你完全可以用命令行方式拿到日志,不用开浏览器。
通过ipmitool读取SEL日志,快速定位故障组件
在Linux管理机上执行:
yum install -y ipmitool ipmitool -I lanplus -H <BMC的IP地址> -U <用户名> -P <密码> sel elist
如果嫌输出太长,可以用sel list只看最后十条记录,重点看Sensor Type和Entity ID字段。
- Sensor Type出现Threshold,对应传感器越界(温度、电压类问题)
- Sensor Type出现Drive Slot,对应硬盘槽位的问题
- 事件描述里带有“Predictive failure”字样,基本可以确定是硬盘预警
结合传感器数据排除环境因素
有时候灯闪是因为机房环境温度过高,BMC里有个“传感器读数”页面,进去看CPU温度、进风口温度、风扇转速这几栏,如果进风口温度超过35摄氏度,风扇转速明显拉高,那可能是机柜散热出了问题,这种情况下指示灯闪烁只是表象,不解决机房散热,换多少盘都没用。
故障代码和指示灯状态的实时联动
联想SR658的固件设计里,诊断面板显示的代码会和BMC日志联动,比如你看到面板显示“Tmp”字样,对应的就是温度警告,这些代码不是随机的,它们对应着一套内部定义的传感器编号,翻看BMC日志时,注意看和诊断面板代码出现相同时间戳的条目,那就是这个灯闪的根因。
如何重置联想sr658服务器警告灯
有时候故障部件已经被替换了,但前面板的黄灯还在闪,这种情况下需要对BMC进行日志清空操作,让系统重新评估一次当前状态:
- 登录XClarity Controller管理界面
- 找到“维护”或“系统日志”菜单
- 选择“清除所有事件日志”或“删除SEL日志”
- 确认操作后,前面板的警告灯会熄灭,诊断面板会恢复到正常显示模式
注意一点:清除日志只影响指示灯状态,不影响实际硬件,如果底层故障没有解除,过几分钟灯还会重新亮起来,把这个问题回到最初的那个结论指示灯是BMC给你递的小纸条,别只看纸条,要顺着纸条找到源头。
最后一个规律送给你:常亮的灯不可怕,怕的是忽明忽暗的规律性闪烁,规律闪烁往往意味着某个部件正在尝试自我修复或重建,这时候最忌讳人为断电,给系统一点时间,配合BMC日志里的时间戳观察规律,你会发现自己也能成为半个售后工程师。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/727315.html


