用smartctl一条命令就能提前看穿硬盘的“亚健康”状态,避免服务器突然宕机、数据丢失的惨剧。
在Linux服务器运维中,硬盘故障是导致数据灾难的“头号杀手”之一,大量案例表明,硬盘在彻底罢工前,通常会通过S.M.A.R.T.数据发出预警信号,smartctl作为smartmontools套件中的核心命令行工具,可以读取这些信号,让运维人员提前介入。
smartctl是什么?为什么服务器运维离不开它?
几乎每一块现代机械硬盘和固态硬盘都内置了S.M.A.R.T.(自我监测、分析及报告技术)系统,它像硬盘的“体检医生”,记录着通电时间、启停次数、坏道数量、温度等关键指标,smartctl正是用来与这个“医生”对话的工具通过发送ATA/SCSI/NVMe指令,获取硬盘内部的健康数据。
行业共识认为,硬盘年故障率会随着使用年限增长显著上升,尤其在运行超过3万小时之后,但很多故障并非突然发生,重映射扇区数、待处理扇区数等指标往往在故障前几周就开始异常,定期用smartctl巡检,相当于给服务器硬盘做“预防性体检”,能大幅降低突发停机风险。
如何快速安装smartctl?(CentOS与Ubuntu演示)
smartctl由smartmontools包提供,几乎所有Linux发行版官方仓库都已收录,安装极其简单,是一个完全免费的硬盘检测方案。
-
CentOS/RHEL 7/8/9
yum install smartmontools -y # CentOS 7 dnf install smartmontools -y # CentOS 8+/Fedora
-
Ubuntu/Debian
apt update && apt install smartmontools -y
-
验证安装
smartctl --version
安装后,smartd守护进程也会一并部署,可用于后台定时监控,但大部分场景下直接使用smartctl命令行就足够,如果执行时遇到“Device does not support SMART”类似错误,通常是因为硬盘通过RAID卡连接,需要指定设备类型,例如加上-d sat或者-d megaraid,N参数。
如何使用smartctl查看硬盘健康状态?
这个命令最常见的用法就是快速输出一份整体健康报告,让你一眼看出硬盘有没有“大毛病”。
查看所有硬盘设备列表
首先要知道系统里有哪些硬盘,可以用lsblk或fdisk -l,但更直接的方法是:
smartctl --scan
它会列出所有可识别的硬盘设备,例如/dev/sda、/dev/sdb,以及对应的磁盘类型(如sat、scsi、nvme),对于NVMe固态硬盘,设备路径一般为/dev/nvme0,命令用法类似。
获取整体健康报告
针对某块硬盘执行:
smartctl -H /dev/sda
输出会显示SMART overall-health self-assessment test result: PASSED或FAILED,如果显示PASSED,说明硬盘自我评估状态正常;如果FAILED,则表示硬盘已检测到严重问题,应立即备份数据并更换,但PASSED不代表完全健康,还需要查看详细属性。
输出所有S.M.A.R.T.信息
smartctl -A /dev/sda
或
smartctl -a /dev/sda
-A只输出属性表,-a则输出全部信息(包括设备信息、属性表、错误日志等),属性表是核心,通常包含数十个参数,后面会详细解读。
smartctl命令详解:常用参数组合
根据不同场景,smartctl可以搭配不同参数,完成信息查询、测试执行、属性监控等任务,下面梳理几个最常用的组合,并附上参数速查表。
| 参数 | 功能 | 示例 |
|---|---|---|
| -i | 查看设备基本信息 | smartctl -i /dev/sda |
| -H | 查看整体健康状态 | smartctl -H /dev/sda |
| -A | 查看S.M.A.R.T.属性表 | smartctl -A /dev/sda |
| -a | 查看所有信息(含日志) | smartctl -a /dev/sda |
| -t short | 执行短自检 | smartctl -t short /dev/sda |
| -t long | 执行长自检 | smartctl -t long /dev/sda |
| -l error | 查看错误日志 | smartctl -l error /dev/sda |
| -l selftest | 查看自检结果 | smartctl -l selftest /dev/sda |
基础信息查询
smartctl -i /dev/sda
显示设备型号、序列号、固件版本、传输模式、S.M.A.R.T.支持情况等,用来确认硬盘身份,避免操作错盘。
查看属性表并解读
smartctl -A /dev/sda
属性表每一行代表一个监控指标,由ID、属性名称、当前值、最差值、阈值、原始值等组成,关键字段:
- VALUE(当前值):标准化后的数值,通常从100开始向下递减,越接近阈值风险越大。
- WORST(最差值):历史记录中的最低值。
- THRESH(阈值):厂商设定的警戒线,当VALUE低于阈值时,代表该指标异常。
- RAW_VALUE(原始值):实际物理计数,如坏扇区数量、通电小时数。
执行后台自检
smartctl -t short /dev/sda # 短自检(2分钟左右) smartctl -t long /dev/sda # 长自检(数小时,取决于容量) smartctl -t conveyance /dev/sda # 传输自检(针对运输损伤)
自检开始后,可以用smartctl -l selftest /dev/sda查看结果,如果自检失败,通常意味着硬盘存在物理损伤。
查看错误日志
smartctl -l error /dev/sda
输出盘片记录的读写错误历史,如果近期频繁出现错误,即便当前属性值正常,也需警惕。
启用/禁用S.M.A.R.T.
smartctl -s on /dev/sda # 启用 smartctl -s off /dev/sda # 禁用
一般出厂默认开启,但某些老服务器或RAID卡可能默认关闭,需要手动开启。
smartctl检测硬盘寿命:从数据看懂硬盘还能撑多久
硬盘寿命预测不是玄学,而是通过关键S.M.A.R.T.属性来判断,下面这些ID是“死亡预警”的核心指标,尤其在国内数据中心日常巡检中,运维团队会重点监控这几项。
必须盯紧的五个属性
-
ID 5 – Reallocated_Sector_Ct(重映射扇区数)
硬盘内部将坏扇区重新映射到备用扇区的次数,原始值若持续增长,说明盘片表面出现物理损伤,备份数据刻不容缓。 -
ID 197 – Current_Pending_Sector(当前待处理扇区数)
硬盘读取时遇到不稳定但尚未重映射的扇区,数值不为零且持续增加,即使当前VALUE正常,也是硬盘即将报废的强烈信号。 -
ID 198 – Offline_Uncorrectable(离线无法纠正的扇区数)
读写时无法纠正的扇区数量,一旦出现,硬盘可靠性已严重下降,多数情况下建议立即更换。 -
ID 187 – Reported_Uncorrect(报告无法纠正的错误数)
通过ECC无法恢复的错误次数,该指标上升,表明磁头或盘片介质存在缺陷。 -
ID 190 – Airflow_Temperature_Cel(或Temperature_Celsius)
硬盘温度,机械硬盘超过50°C、固态硬盘超过70°C会加速老化,这个指标虽然不直接指向寿命,但长期高温会使故障率上升。
如何判断“还能用多久”?
没有一个绝对的时间公式,但有一条经验法则:当ID 5和ID 197的原始值同时大于0,且呈增长趋势,就应该在两周内完成数据迁移和更换。 如果ID 198出现任何非零值,则应立即停机更换。
可以用一个简单的脚本持续记录这些值,观察趋势:
#!/bin/bash # 记录关键SMART指标到日志 date >> /var/log/smart_watch.log for dev in /dev/sd[a-z]; do smartctl -A $dev | grep -E "Reallocated_Sector_Ct|Current_Pending_Sector|Offline_Uncorrectable|Temperature_Celsius" >> /var/log/smart_watch.log done
配合cron每天执行,就能形成趋势图。
实战:用smartctl搭建自动化硬盘监控脚本
手动检查太累,我们完全可以写一个简单的监控脚本,结合cron定时任务,当硬盘出现异常时主动发送邮件或企微/钉钉告警,这个方案在国内很多机房托管服务器上被广泛采用,成本为零,可靠性却很高。
脚本思路
- 遍历所有SATA/SAS硬盘(可从
/dev/disk/by-path/或smartctl --scan获得)。 - 对每块硬盘执行
smartctl -H,检查PASSED状态。 - 提取关键属性ID 5、197、198的原始值,与预设阈值比较。
- 异常时调用告警命令(如
mail、curl发送webhook)。
示例脚本(简化版)
#!/bin/bash
ALERT_LOG="/tmp/smart_alert.log"
> $ALERT_LOG
for disk in /dev/sd[a-z]; do
if smartctl -H $disk | grep -q "FAILED"; then
echo "$disk SMART Health FAILED!" >> $ALERT_LOG
fi
# 检查待处理扇区
pending=$(smartctl -A $disk | grep "Current_Pending_Sector" | awk '{print $NF}')
if [ -n "$pending" ] && [ "$pending" -gt 0 ]; then
echo "$disk has $pending pending sectors!" >> $ALERT_LOG
fi
done
if [ -s $ALERT_LOG ]; then
mail -s "SMART Alert on $(hostname)" admin@example.com < $ALERT_LOG
fi
将此脚本加入/etc/crontab,每天凌晨2点执行一次:
0 2 root /path/to/script.sh
这样就能实现无人值守的硬盘健康监控,特别适合运行着多块硬盘的NAS、文件服务器或数据库服务器。
smartctl是Linux世界里最直接、最透明的硬盘健康检测工具,没有之一,它不依赖复杂的图形界面,一条命令就能直击要害,对于运维人员来说,与其等硬盘坏了再手忙脚乱地恢复数据,不如每天花几秒钟扫一眼S.M.A.R.T.属性,把灾难扼杀在萌芽里。
linux smartctl常见问题解答
怎么用smartctl检测硬盘寿命?
检测硬盘寿命主要观察几个关键S.M.A.R.T.属性:重映射扇区数(ID 5)、当前待处理扇区数(ID 197)、离线无法纠正扇区数(ID 198),执行smartctl -A /dev/sda,查看这三个属性的RAW_VALUE列,如果ID 5或ID 197持续增长,说明硬盘盘片已出现物理损伤;ID 198出现非零值则代表坏扇区已无法修复,需立即更换。
smartctl和badblocks的区别是什么?
smartctl读取的是硬盘内部固件记录的S.M.A.R.T.数据,属于被动监控,不产生额外磨损,反映的是硬盘全生命周期的状态,badblocks则是主动对磁盘表面进行读写测试,可以发现文件系统不可见的坏块,但测试过程会全盘读写,对盘片有磨损,适合在新盘或怀疑有坏道时进行销毁性验证,两者互补,通常先用smartctl筛查,再用badblocks确认。
linux smartctl命令详解在哪里看?
最权威的说明是内置的man手册,执行man smartctl即可查阅所有参数和用法,也可以访问smartmontools官网获取在线文档,对于中文用户,常见技术博客有大量参数翻译和案例,但版本迭代较快,建议以man手册为准。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/507650.html



