linux smartctl是什么,怎么用?

用smartctl一条命令就能提前看穿硬盘的“亚健康”状态,避免服务器突然宕机、数据丢失的惨剧。

在Linux服务器运维中,硬盘故障是导致数据灾难的“头号杀手”之一,大量案例表明,硬盘在彻底罢工前,通常会通过S.M.A.R.T.数据发出预警信号,smartctl作为smartmontools套件中的核心命令行工具,可以读取这些信号,让运维人员提前介入。

Linux命令精讲之smartctl/hdparm(磁盘健康)
加载中
Linux命令精讲之smartctl/hdparm(磁盘健康)

smartctl是什么?为什么服务器运维离不开它?

几乎每一块现代机械硬盘和固态硬盘都内置了S.M.A.R.T.(自我监测、分析及报告技术)系统,它像硬盘的“体检医生”,记录着通电时间、启停次数、坏道数量、温度等关键指标,smartctl正是用来与这个“医生”对话的工具通过发送ATA/SCSI/NVMe指令,获取硬盘内部的健康数据。

行业共识认为,硬盘年故障率会随着使用年限增长显著上升,尤其在运行超过3万小时之后,但很多故障并非突然发生,重映射扇区数、待处理扇区数等指标往往在故障前几周就开始异常,定期用smartctl巡检,相当于给服务器硬盘做“预防性体检”,能大幅降低突发停机风险。

如何快速安装smartctl?(CentOS与Ubuntu演示)

smartctl由smartmontools包提供,几乎所有Linux发行版官方仓库都已收录,安装极其简单,是一个完全免费的硬盘检测方案。

  • CentOS/RHEL 7/8/9

    yum install smartmontools -y   # CentOS 7
    dnf install smartmontools -y   # CentOS 8+/Fedora
  • Ubuntu/Debian

    apt update && apt install smartmontools -y
  • 验证安装

    smartctl --version

安装后,smartd守护进程也会一并部署,可用于后台定时监控,但大部分场景下直接使用smartctl命令行就足够,如果执行时遇到“Device does not support SMART”类似错误,通常是因为硬盘通过RAID卡连接,需要指定设备类型,例如加上-d sat或者-d megaraid,N参数。

如何使用smartctl查看硬盘健康状态?

这个命令最常见的用法就是快速输出一份整体健康报告,让你一眼看出硬盘有没有“大毛病”。

查看所有硬盘设备列表

首先要知道系统里有哪些硬盘,可以用lsblkfdisk -l,但更直接的方法是:

smartctl --scan

它会列出所有可识别的硬盘设备,例如/dev/sda/dev/sdb,以及对应的磁盘类型(如satscsinvme),对于NVMe固态硬盘,设备路径一般为/dev/nvme0,命令用法类似。

获取整体健康报告

针对某块硬盘执行:

smartctl -H /dev/sda

linux smartctl是什么,怎么用?

输出会显示SMART overall-health self-assessment test result: PASSEDFAILED,如果显示PASSED,说明硬盘自我评估状态正常;如果FAILED,则表示硬盘已检测到严重问题,应立即备份数据并更换,但PASSED不代表完全健康,还需要查看详细属性。

输出所有S.M.A.R.T.信息

smartctl -A /dev/sda

smartctl -a /dev/sda

-A只输出属性表,-a则输出全部信息(包括设备信息、属性表、错误日志等),属性表是核心,通常包含数十个参数,后面会详细解读。

smartctl命令详解:常用参数组合

根据不同场景,smartctl可以搭配不同参数,完成信息查询、测试执行、属性监控等任务,下面梳理几个最常用的组合,并附上参数速查表。

参数 功能 示例
-i 查看设备基本信息 smartctl -i /dev/sda
-H 查看整体健康状态 smartctl -H /dev/sda
-A 查看S.M.A.R.T.属性表 smartctl -A /dev/sda
-a 查看所有信息(含日志) smartctl -a /dev/sda
-t short 执行短自检 smartctl -t short /dev/sda
-t long 执行长自检 smartctl -t long /dev/sda
-l error 查看错误日志 smartctl -l error /dev/sda
-l selftest 查看自检结果 smartctl -l selftest /dev/sda

基础信息查询

smartctl -i /dev/sda

显示设备型号、序列号、固件版本、传输模式、S.M.A.R.T.支持情况等,用来确认硬盘身份,避免操作错盘。

查看属性表并解读

smartctl -A /dev/sda

属性表每一行代表一个监控指标,由ID、属性名称、当前值、最差值、阈值、原始值等组成,关键字段:

  • VALUE(当前值):标准化后的数值,通常从100开始向下递减,越接近阈值风险越大。
  • WORST(最差值):历史记录中的最低值。
  • THRESH(阈值):厂商设定的警戒线,当VALUE低于阈值时,代表该指标异常。
  • RAW_VALUE(原始值):实际物理计数,如坏扇区数量、通电小时数。

执行后台自检

smartctl -t short /dev/sda   # 短自检(2分钟左右)
smartctl -t long /dev/sda    # 长自检(数小时,取决于容量)
smartctl -t conveyance /dev/sda  # 传输自检(针对运输损伤)

自检开始后,可以用smartctl -l selftest /dev/sda查看结果,如果自检失败,通常意味着硬盘存在物理损伤。

linux smartctl是什么,怎么用?

查看错误日志

smartctl -l error /dev/sda

输出盘片记录的读写错误历史,如果近期频繁出现错误,即便当前属性值正常,也需警惕。

启用/禁用S.M.A.R.T.

smartctl -s on /dev/sda   # 启用
smartctl -s off /dev/sda  # 禁用

一般出厂默认开启,但某些老服务器或RAID卡可能默认关闭,需要手动开启。

smartctl检测硬盘寿命:从数据看懂硬盘还能撑多久

硬盘寿命预测不是玄学,而是通过关键S.M.A.R.T.属性来判断,下面这些ID是“死亡预警”的核心指标,尤其在国内数据中心日常巡检中,运维团队会重点监控这几项。

必须盯紧的五个属性

  • ID 5 – Reallocated_Sector_Ct(重映射扇区数)
    硬盘内部将坏扇区重新映射到备用扇区的次数,原始值若持续增长,说明盘片表面出现物理损伤,备份数据刻不容缓。

  • ID 197 – Current_Pending_Sector(当前待处理扇区数)
    硬盘读取时遇到不稳定但尚未重映射的扇区,数值不为零且持续增加,即使当前VALUE正常,也是硬盘即将报废的强烈信号。

  • ID 198 – Offline_Uncorrectable(离线无法纠正的扇区数)
    读写时无法纠正的扇区数量,一旦出现,硬盘可靠性已严重下降,多数情况下建议立即更换。

  • ID 187 – Reported_Uncorrect(报告无法纠正的错误数)
    通过ECC无法恢复的错误次数,该指标上升,表明磁头或盘片介质存在缺陷。

  • ID 190 – Airflow_Temperature_Cel(或Temperature_Celsius)
    硬盘温度,机械硬盘超过50°C、固态硬盘超过70°C会加速老化,这个指标虽然不直接指向寿命,但长期高温会使故障率上升。

如何判断“还能用多久”?

没有一个绝对的时间公式,但有一条经验法则:当ID 5和ID 197的原始值同时大于0,且呈增长趋势,就应该在两周内完成数据迁移和更换。 如果ID 198出现任何非零值,则应立即停机更换。

可以用一个简单的脚本持续记录这些值,观察趋势:

#!/bin/bash
# 记录关键SMART指标到日志
date >> /var/log/smart_watch.log
for dev in /dev/sd[a-z]; do
  smartctl -A $dev | grep -E "Reallocated_Sector_Ct|Current_Pending_Sector|Offline_Uncorrectable|Temperature_Celsius" >> /var/log/smart_watch.log
done

配合cron每天执行,就能形成趋势图。

实战:用smartctl搭建自动化硬盘监控脚本

手动检查太累,我们完全可以写一个简单的监控脚本,结合cron定时任务,当硬盘出现异常时主动发送邮件或企微/钉钉告警,这个方案在国内很多机房托管服务器上被广泛采用,成本为零,可靠性却很高。

linux smartctl是什么,怎么用?

脚本思路

  1. 遍历所有SATA/SAS硬盘(可从/dev/disk/by-path/smartctl --scan获得)。
  2. 对每块硬盘执行smartctl -H,检查PASSED状态。
  3. 提取关键属性ID 5、197、198的原始值,与预设阈值比较。
  4. 异常时调用告警命令(如mailcurl发送webhook)。

示例脚本(简化版)

#!/bin/bash
ALERT_LOG="/tmp/smart_alert.log"
> $ALERT_LOG
for disk in /dev/sd[a-z]; do
  if smartctl -H $disk | grep -q "FAILED"; then
    echo "$disk SMART Health FAILED!" >> $ALERT_LOG
  fi
  # 检查待处理扇区
  pending=$(smartctl -A $disk | grep "Current_Pending_Sector" | awk '{print $NF}')
  if [ -n "$pending" ] && [ "$pending" -gt 0 ]; then
    echo "$disk has $pending pending sectors!" >> $ALERT_LOG
  fi
done
if [ -s $ALERT_LOG ]; then
  mail -s "SMART Alert on $(hostname)" admin@example.com < $ALERT_LOG
fi

将此脚本加入/etc/crontab,每天凌晨2点执行一次:

0 2    root /path/to/script.sh

这样就能实现无人值守的硬盘健康监控,特别适合运行着多块硬盘的NAS、文件服务器或数据库服务器。

smartctl是Linux世界里最直接、最透明的硬盘健康检测工具,没有之一,它不依赖复杂的图形界面,一条命令就能直击要害,对于运维人员来说,与其等硬盘坏了再手忙脚乱地恢复数据,不如每天花几秒钟扫一眼S.M.A.R.T.属性,把灾难扼杀在萌芽里。

linux smartctl常见问题解答

怎么用smartctl检测硬盘寿命?

检测硬盘寿命主要观察几个关键S.M.A.R.T.属性:重映射扇区数(ID 5)、当前待处理扇区数(ID 197)、离线无法纠正扇区数(ID 198),执行smartctl -A /dev/sda,查看这三个属性的RAW_VALUE列,如果ID 5或ID 197持续增长,说明硬盘盘片已出现物理损伤;ID 198出现非零值则代表坏扇区已无法修复,需立即更换。

smartctl和badblocks的区别是什么?

smartctl读取的是硬盘内部固件记录的S.M.A.R.T.数据,属于被动监控,不产生额外磨损,反映的是硬盘全生命周期的状态,badblocks则是主动对磁盘表面进行读写测试,可以发现文件系统不可见的坏块,但测试过程会全盘读写,对盘片有磨损,适合在新盘或怀疑有坏道时进行销毁性验证,两者互补,通常先用smartctl筛查,再用badblocks确认。

linux smartctl命令详解在哪里看?

最权威的说明是内置的man手册,执行man smartctl即可查阅所有参数和用法,也可以访问smartmontools官网获取在线文档,对于中文用户,常见技术博客有大量参数翻译和案例,但版本迭代较快,建议以man手册为准。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://idctop.com/article/507650.html

(0)
免费的cdn加速哪个好?免费的cdn加速推荐
上一篇 2026年7月21日 01:02
linux子命令怎么用?linux常用子命令大全
下一篇 2026年7月4日 07:18

相关推荐

  • Linux FTP PASV模式怎么配置,FTP被动模式端口如何开放?

    FTP 被动模式 (PASV) 详解在 Linux 环境下配置 FTP 服务时,被动模式 (Passive Mode) 是解决防火墙和 NAT(网络地址转换)导致连接失败的关键技术,什么是 FTP 被动模式?FTP 协议在传输数据时会建立两个独立的通道:命令通道 (Command Channel):用于发送指令……

    2026年7月14日
    400
  • linux下rar和zip怎么解压?linux解压rar和zip文件命令

    在Linux环境下,RAR格式因专利限制需安装专用工具,而ZIP作为开源标准无需额外软件即可原生支持,日常归档优先推荐ZIP,解压RAR文件则需配置第三方库,Linux下压缩格式的核心差异与选择逻辑在Linux服务器运维和日常文件管理中,压缩工具的选择往往决定了效率的上限,许多新手用户常陷入“RAR比ZIP压缩……

    2026年7月5日
    4600
  • linux 无线键盘

    在Linux系统下,无线键盘并非简单的即插即用设备,其核心优势在于通过蓝牙或2.4G接收器实现多设备协同与低功耗长续航,但需关注驱动兼容性与连接稳定性,对于许多刚接触Linux发行版的用户而言,外设的“开箱即用”体验往往是决定去留的关键因素,Windows系统下无需配置的无线键盘,在Linux中可能需要经历一番……

    2026年7月5日
    7900
  • linux赋值命令怎么用?linux变量赋值方法详解

    Linux中赋值的核心命令是export用于设置环境变量,以及VAR=value用于设置普通变量,两者在作用域和持久性上存在本质区别,前者影响子进程,后者仅限当前Shell会话,在Linux系统运维和开发场景中,变量赋值看似基础,却是构建自动化脚本、配置运行环境以及排查故障的基石,许多初学者常混淆普通变量与环境……

    2026年7月7日
    2000
  • 如何在Linux进入SQL?linux连接mysql数据库详细教程

    在Linux终端进入SQL环境的核心步骤是安装数据库客户端(如MySQL的mysql命令或PostgreSQL的psql),并通过命令行参数指定用户名、密码及主机地址,或直接输入命令后交互式输入凭证即可连接数据库,对于许多刚接触Linux服务器的开发者或运维人员来说,命令行界面往往给人一种冷冰冰且难以接近的印象……

    2026年7月5日
    15100
  • cpuburn for linux怎么用?linux cpu压力测试工具推荐

    CPUBurn for Linux 是一款轻量级、基于汇编指令的 CPU 压力测试工具,通过执行特定的浮点运算指令集来快速提升 CPU 温度,是验证散热系统效能和系统稳定性的首选方案,在 Linux 服务器运维或硬件发烧友的圈子里,验证散热方案是否达标往往不需要复杂的商业软件,CPUBurn 凭借其极低的资源占……

    2026年7月9日
    7000
  • linux磁盘空间不足怎么分析?linux系统磁盘清理方法

    Linux磁盘分析的核心在于结合df查看空间利用率与du定位具体文件,通过iostat监控IO性能瓶颈,从而快速解决磁盘满或读写慢的问题,当服务器报警或系统响应变慢时,运维人员首先需要判断是容量耗尽还是性能瓶颈,这就像体检,既要看体重是否超标(容量),也要看心肺功能是否正常(IO性能),盲目删除文件往往治标不治……

    2026年7月7日
    4100
  • Linux Mint引导失败怎么办?Linux Mint安装后无法启动怎么解决

    Linux Mint 引导失败通常由 EFI 分区配置错误、GRUB 引导记录损坏或双系统时间冲突引起,最直接的修复方案是使用 Live USB 进入救援模式,通过 chroot 环境重新安装并更新 GRUB 引导加载程序,当你在电脑开机时看到黑屏、Grub Rescue 提示或者直接进入 Windows 而忽……

    2026年7月8日
    5300
  • linux http上传失败怎么办?linux下http文件上传教程

    在Linux环境下通过HTTP上传文件,最稳定且通用的方案是使用curl命令配合表单数据,或者利用Nginx/Apache配置Web服务器接收POST请求,具体选择取决于你是作为客户端发送还是服务端接收,很多人提到Linux上传,第一反应是FTP或SFTP,但在现代Web开发和自动化运维中,HTTP协议因其无状……

    2026年7月8日
    5300
  • linux gnustep是什么?,怎么安装?

    GNUstep 在 Linux 上实现了一套完整的 OpenStep 兼容框架,是使用 Objective-C 进行跨平台桌面应用开发的首选开源方案,尤其适合从 macOS 迁移项目或进行教学实践,GNUstep 是什么,为什么 Linux 开发者仍在关注它GNUstep 是 OpenStep 标准(由 NeX……

    2026年7月20日
    100

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注