linux smartctl是什么,怎么用?

用smartctl一条命令就能提前看穿硬盘的“亚健康”状态,避免服务器突然宕机、数据丢失的惨剧。

在Linux服务器运维中,硬盘故障是导致数据灾难的“头号杀手”之一,大量案例表明,硬盘在彻底罢工前,通常会通过S.M.A.R.T.数据发出预警信号,smartctl作为smartmontools套件中的核心命令行工具,可以读取这些信号,让运维人员提前介入。

Linux命令精讲之smartctl/hdparm(磁盘健康)
加载中
Linux命令精讲之smartctl/hdparm(磁盘健康)

smartctl是什么?为什么服务器运维离不开它?

几乎每一块现代机械硬盘和固态硬盘都内置了S.M.A.R.T.(自我监测、分析及报告技术)系统,它像硬盘的“体检医生”,记录着通电时间、启停次数、坏道数量、温度等关键指标,smartctl正是用来与这个“医生”对话的工具通过发送ATA/SCSI/NVMe指令,获取硬盘内部的健康数据。

行业共识认为,硬盘年故障率会随着使用年限增长显著上升,尤其在运行超过3万小时之后,但很多故障并非突然发生,重映射扇区数、待处理扇区数等指标往往在故障前几周就开始异常,定期用smartctl巡检,相当于给服务器硬盘做“预防性体检”,能大幅降低突发停机风险。

如何快速安装smartctl?(CentOS与Ubuntu演示)

smartctl由smartmontools包提供,几乎所有Linux发行版官方仓库都已收录,安装极其简单,是一个完全免费的硬盘检测方案。

  • CentOS/RHEL 7/8/9

    yum install smartmontools -y   # CentOS 7
    dnf install smartmontools -y   # CentOS 8+/Fedora
  • Ubuntu/Debian

    apt update && apt install smartmontools -y
  • 验证安装

    smartctl --version

安装后,smartd守护进程也会一并部署,可用于后台定时监控,但大部分场景下直接使用smartctl命令行就足够,如果执行时遇到“Device does not support SMART”类似错误,通常是因为硬盘通过RAID卡连接,需要指定设备类型,例如加上-d sat或者-d megaraid,N参数。

如何使用smartctl查看硬盘健康状态?

这个命令最常见的用法就是快速输出一份整体健康报告,让你一眼看出硬盘有没有“大毛病”。

查看所有硬盘设备列表

首先要知道系统里有哪些硬盘,可以用lsblkfdisk -l,但更直接的方法是:

smartctl --scan

它会列出所有可识别的硬盘设备,例如/dev/sda/dev/sdb,以及对应的磁盘类型(如satscsinvme),对于NVMe固态硬盘,设备路径一般为/dev/nvme0,命令用法类似。

获取整体健康报告

针对某块硬盘执行:

smartctl -H /dev/sda

linux smartctl是什么,怎么用?

输出会显示SMART overall-health self-assessment test result: PASSEDFAILED,如果显示PASSED,说明硬盘自我评估状态正常;如果FAILED,则表示硬盘已检测到严重问题,应立即备份数据并更换,但PASSED不代表完全健康,还需要查看详细属性。

输出所有S.M.A.R.T.信息

smartctl -A /dev/sda

smartctl -a /dev/sda

-A只输出属性表,-a则输出全部信息(包括设备信息、属性表、错误日志等),属性表是核心,通常包含数十个参数,后面会详细解读。

smartctl命令详解:常用参数组合

根据不同场景,smartctl可以搭配不同参数,完成信息查询、测试执行、属性监控等任务,下面梳理几个最常用的组合,并附上参数速查表。

参数 功能 示例
-i 查看设备基本信息 smartctl -i /dev/sda
-H 查看整体健康状态 smartctl -H /dev/sda
-A 查看S.M.A.R.T.属性表 smartctl -A /dev/sda
-a 查看所有信息(含日志) smartctl -a /dev/sda
-t short 执行短自检 smartctl -t short /dev/sda
-t long 执行长自检 smartctl -t long /dev/sda
-l error 查看错误日志 smartctl -l error /dev/sda
-l selftest 查看自检结果 smartctl -l selftest /dev/sda

基础信息查询

smartctl -i /dev/sda

显示设备型号、序列号、固件版本、传输模式、S.M.A.R.T.支持情况等,用来确认硬盘身份,避免操作错盘。

查看属性表并解读

smartctl -A /dev/sda

属性表每一行代表一个监控指标,由ID、属性名称、当前值、最差值、阈值、原始值等组成,关键字段:

  • VALUE(当前值):标准化后的数值,通常从100开始向下递减,越接近阈值风险越大。
  • WORST(最差值):历史记录中的最低值。
  • THRESH(阈值):厂商设定的警戒线,当VALUE低于阈值时,代表该指标异常。
  • RAW_VALUE(原始值):实际物理计数,如坏扇区数量、通电小时数。

执行后台自检

smartctl -t short /dev/sda   # 短自检(2分钟左右)
smartctl -t long /dev/sda    # 长自检(数小时,取决于容量)
smartctl -t conveyance /dev/sda  # 传输自检(针对运输损伤)

自检开始后,可以用smartctl -l selftest /dev/sda查看结果,如果自检失败,通常意味着硬盘存在物理损伤。

linux smartctl是什么,怎么用?

查看错误日志

smartctl -l error /dev/sda

输出盘片记录的读写错误历史,如果近期频繁出现错误,即便当前属性值正常,也需警惕。

启用/禁用S.M.A.R.T.

smartctl -s on /dev/sda   # 启用
smartctl -s off /dev/sda  # 禁用

一般出厂默认开启,但某些老服务器或RAID卡可能默认关闭,需要手动开启。

smartctl检测硬盘寿命:从数据看懂硬盘还能撑多久

硬盘寿命预测不是玄学,而是通过关键S.M.A.R.T.属性来判断,下面这些ID是“死亡预警”的核心指标,尤其在国内数据中心日常巡检中,运维团队会重点监控这几项。

必须盯紧的五个属性

  • ID 5 – Reallocated_Sector_Ct(重映射扇区数)
    硬盘内部将坏扇区重新映射到备用扇区的次数,原始值若持续增长,说明盘片表面出现物理损伤,备份数据刻不容缓。

  • ID 197 – Current_Pending_Sector(当前待处理扇区数)
    硬盘读取时遇到不稳定但尚未重映射的扇区,数值不为零且持续增加,即使当前VALUE正常,也是硬盘即将报废的强烈信号。

  • ID 198 – Offline_Uncorrectable(离线无法纠正的扇区数)
    读写时无法纠正的扇区数量,一旦出现,硬盘可靠性已严重下降,多数情况下建议立即更换。

  • ID 187 – Reported_Uncorrect(报告无法纠正的错误数)
    通过ECC无法恢复的错误次数,该指标上升,表明磁头或盘片介质存在缺陷。

  • ID 190 – Airflow_Temperature_Cel(或Temperature_Celsius)
    硬盘温度,机械硬盘超过50°C、固态硬盘超过70°C会加速老化,这个指标虽然不直接指向寿命,但长期高温会使故障率上升。

如何判断“还能用多久”?

没有一个绝对的时间公式,但有一条经验法则:当ID 5和ID 197的原始值同时大于0,且呈增长趋势,就应该在两周内完成数据迁移和更换。 如果ID 198出现任何非零值,则应立即停机更换。

可以用一个简单的脚本持续记录这些值,观察趋势:

#!/bin/bash
# 记录关键SMART指标到日志
date >> /var/log/smart_watch.log
for dev in /dev/sd[a-z]; do
  smartctl -A $dev | grep -E "Reallocated_Sector_Ct|Current_Pending_Sector|Offline_Uncorrectable|Temperature_Celsius" >> /var/log/smart_watch.log
done

配合cron每天执行,就能形成趋势图。

实战:用smartctl搭建自动化硬盘监控脚本

手动检查太累,我们完全可以写一个简单的监控脚本,结合cron定时任务,当硬盘出现异常时主动发送邮件或企微/钉钉告警,这个方案在国内很多机房托管服务器上被广泛采用,成本为零,可靠性却很高。

linux smartctl是什么,怎么用?

脚本思路

  1. 遍历所有SATA/SAS硬盘(可从/dev/disk/by-path/smartctl --scan获得)。
  2. 对每块硬盘执行smartctl -H,检查PASSED状态。
  3. 提取关键属性ID 5、197、198的原始值,与预设阈值比较。
  4. 异常时调用告警命令(如mailcurl发送webhook)。

示例脚本(简化版)

#!/bin/bash
ALERT_LOG="/tmp/smart_alert.log"
> $ALERT_LOG
for disk in /dev/sd[a-z]; do
  if smartctl -H $disk | grep -q "FAILED"; then
    echo "$disk SMART Health FAILED!" >> $ALERT_LOG
  fi
  # 检查待处理扇区
  pending=$(smartctl -A $disk | grep "Current_Pending_Sector" | awk '{print $NF}')
  if [ -n "$pending" ] && [ "$pending" -gt 0 ]; then
    echo "$disk has $pending pending sectors!" >> $ALERT_LOG
  fi
done
if [ -s $ALERT_LOG ]; then
  mail -s "SMART Alert on $(hostname)" admin@example.com < $ALERT_LOG
fi

将此脚本加入/etc/crontab,每天凌晨2点执行一次:

0 2    root /path/to/script.sh

这样就能实现无人值守的硬盘健康监控,特别适合运行着多块硬盘的NAS、文件服务器或数据库服务器。

smartctl是Linux世界里最直接、最透明的硬盘健康检测工具,没有之一,它不依赖复杂的图形界面,一条命令就能直击要害,对于运维人员来说,与其等硬盘坏了再手忙脚乱地恢复数据,不如每天花几秒钟扫一眼S.M.A.R.T.属性,把灾难扼杀在萌芽里。

linux smartctl常见问题解答

怎么用smartctl检测硬盘寿命?

检测硬盘寿命主要观察几个关键S.M.A.R.T.属性:重映射扇区数(ID 5)、当前待处理扇区数(ID 197)、离线无法纠正扇区数(ID 198),执行smartctl -A /dev/sda,查看这三个属性的RAW_VALUE列,如果ID 5或ID 197持续增长,说明硬盘盘片已出现物理损伤;ID 198出现非零值则代表坏扇区已无法修复,需立即更换。

smartctl和badblocks的区别是什么?

smartctl读取的是硬盘内部固件记录的S.M.A.R.T.数据,属于被动监控,不产生额外磨损,反映的是硬盘全生命周期的状态,badblocks则是主动对磁盘表面进行读写测试,可以发现文件系统不可见的坏块,但测试过程会全盘读写,对盘片有磨损,适合在新盘或怀疑有坏道时进行销毁性验证,两者互补,通常先用smartctl筛查,再用badblocks确认。

linux smartctl命令详解在哪里看?

最权威的说明是内置的man手册,执行man smartctl即可查阅所有参数和用法,也可以访问smartmontools官网获取在线文档,对于中文用户,常见技术博客有大量参数翻译和案例,但版本迭代较快,建议以man手册为准。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://idctop.com/article/507650.html

(0)
免费的cdn加速哪个好?免费的cdn加速推荐
上一篇 2026年7月21日 01:02
CDN的部署方法有哪些?,cdn部署方法怎么选最好
下一篇 2026年7月21日 01:08

相关推荐

  • mesa linux

    Mesa Linux本质上是Linux系统中的开源图形驱动栈与实现规范,它直接对接显卡硬件,提供从基础2D渲染到复杂3D加速的底层支持,是绝大多数Linux桌面环境运行图形任务的基石,Mesa Linux的核心架构与工作原理在Linux图形生态中,Mesa扮演着“翻译官”的角色,应用程序(如游戏、浏览器、渲染软……

    2026年7月15日
    2300
  • 戴尔服务器r740延保多少钱,怎么续保?

    戴尔R740服务器延保费用并非固定标价,它取决于机器的出厂配置、已使用年限、延保年限以及您选择的服务响应级别,一年延保费用从几百元到数千元不等,具体金额需通过官方或授权服务商根据序列号查询,影响戴尔R740延保价格的核心因素延保定价逻辑与服务器生命周期紧密相关,了解这些因素能帮您预估成本,避免预算偏差,服务器当……

    2026年8月23日
    500
  • BurnInTest在Linux上怎么用,如何测试

    BurnInTest Linux是PassMark推出的命令行硬件压力测试工具,专为Linux环境设计,虽无图形界面,但功能扎实,是服务器和嵌入式系统稳定性验证的利器,BurnInTest Linux安装与命令详解如果你需要在Linux系统上快速验证硬件稳定性,BurnInTest Linux版是最直接的选择……

    2026年7月20日
    1900
  • h100 8卡服务器多少钱?,最新报价是多少

    H100 8卡服务器多少钱?当前市场单台裸机价格普遍落在110万至150万人民币区间(含税),具体成交价取决于显存版本、散热方式、供货渠道与保修条款,这个价位听起来确实吓人,但拆开来看,你会发现每一分钱都花在了刀刃上,H100 8卡服务器不是普通的PC,它是为大模型训练和推理量身打造的生产力工具,作为在IDC行……

    2026年8月27日
    2700
  • 日活一万的app服务器需要多少钱,怎么选?

    日活一万的App,服务器成本通常在每月800元到3000元之间,具体取决于你的技术架构、服务商定价和资源使用方式,这个区间覆盖了从单体架构上云到简单集群部署的常见场景,如果你选择自建机房或使用高端定制方案,费用会更高,但对绝大多数创业团队来说,初期在这个预算内就能稳定支撑一万日活,下面我们把每一笔钱拆开来看,成……

    2026年8月21日
    400
  • 四川绵阳移动dns的服务器地址是多少?,在哪里设置?

    四川绵阳移动的DNS服务器地址官方指定为:主DNS 211.137.96.205,备用DNS 211.137.96.206,这对地址由中国移动绵阳分公司维护,覆盖全市移动宽带用户,解析延迟低,无论你使用家庭宽带还是企业专线,手动设置这对地址能有效避免自动获取时的缓存污染和跳转问题,为什么说这对地址是绵阳移动的首……

    2026年8月6日
    600
  • 服务器硬盘一年要花多少钱?租用和买断哪个更划算

    服务器硬盘一年费用通常在几百元到数千元不等,它很少单独收费,绝大多数情况下硬盘成本已经打包在服务器租用或托管总价中,真正决定你为硬盘付出多少钱的因素,是硬盘类型、容量、读写性能,以及你选择的计费模式,下面从真实业务场景出发,把各类硬盘的年成本彻底拆清楚,服务器硬盘成本藏在三种计费场景里要算清“一年多少钱”,先分……

    2026年8月26日
    500
  • 1h1g服务器可以让多少人同时访问,怎么选?

    1h1g服务器(1核1GB内存)在多数日常场景下,大约能承受几十到上百人同时访问,具体取决于网站类型、程序优化和是否使用缓存等加速手段,这个结论不是固定数字,而是基于大量运维经验得出的参考范围,如果只放静态页面,并发量可以轻松翻倍;如果运行复杂动态程序,人数会明显下降,接下来我们拆开细说,帮你判断自己的站点到底……

    2026年7月26日
    600
  • 一台服务器一天耗电多少度,电费一个月多少钱?

    一台服务器每天耗电通常在5到30度之间,具体取决于配置、负载和运行环境,例如一台中等配置的机架服务器满载运行一天大约耗电15度,服务器功耗由哪些因素决定硬件配置服务器功耗的核心来源是硬件组件,**CPU**是最主要的耗电单元,高核心数、高频率的处理器(如Intel Xeon或AMD EPYC系列)在满载时功耗可……

    2026年8月24日
    700
  • 一台服务器最多能建几个RAID?,RAID卡怎么选?

    一台服务器可创建的RAID数量主要取决于硬盘槽位数量、RAID控制器规格以及所选RAID类型,多数主流服务器默认支持1-2组独立RAID阵列,搭配专业阵列卡后可扩展至8组甚至更多,服务器RAID数量的决定因素硬件层面:硬盘槽位是第一道门槛服务器硬盘槽位决定了物理磁盘的上限,也就锁定了RAID的组建空间,以常见的……

    2026年8月13日
    1300

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注