【开发工具】【smartctl】硬盘检测工具（smartctl）的使用

2024-07-09 14:20| 来源: 网络整理| 查看: 265

概述

随着硬盘容量、速度的快速发展，硬盘的可靠性问题越来越重要，今天的单块硬盘存储容量可轻松达到1TB，硬盘损坏带来的影响非常巨大。

不同的文件系统(xfs,reiserfs,ext3)都有自己的检测和修复工具。检测之前可以先使用dmesg命令查看有没有硬件I/O故障的日志，如果有，先用fsck看看是不是文件系统有问题，如果不是则可以使用下面介绍硬盘检测和优化方法来修复它。grep “error” /va/log/messages*;

SMART是一种磁盘自我分析检测技术，早在90年代末就基本得到了普及每一块硬盘（包括IDE、SCSI），在运行的时候都会将自身的若干参数记录下来，这些参数包括型号、容量、温度、密度、扇区、寻道时间、传输、误码率等。硬盘运行了几千小时后，很多内在的物理参数都会发生变化，某一参数超过报警阈值，则说明硬盘接近损坏，此时硬盘依然在工作，如果用户不理睬这个报警继续使用，那么硬盘将变得非常不可靠，随时可能故障。

如何启用SMART

SMART是和主板BIOS上相应功能配合的，要使用SMART，必须先进入到主板BIOS设置里边启动相关设置。一般从Pentium2级别起的主板，都支持SMART，BIOS启动以后，就是操作系统级别的事情了（Windows没有内置SMART相关工具,需要安装第三方工具软件)，好在Linux上很早就有了SMART支持了,如果把Linux装在VMware等虚拟机上，在系统启动时候可以看到有个服务启动报错：smartd。这个服务器就是smart的daemon进程（因为vmware虚拟机的硬盘不支持SMART，所以报错）。smartd是一个守护进程（一个帮助程序）,它能监视拥有自我监视,分析和汇报技术(Self-Monitoring,Analysis, and Reporting Technology -SMART)的硬盘。SMART体系使得硬盘能监视并汇报自己的运行状况.它的一个重要特性是能够预测失败,使得系统管理员能避免数据丢失。

smartctl简单用法 smartctl -a 说明：检查该设备是否已经打开SMART技术。 smartctl -s on 说明：如果没有打开SMART技术，使用该命令打开SMART技术。 smartctl -t short 说明：后台检测硬盘，消耗时间短； smartctl -t long 说明：后台检测硬盘，消耗时间长； smartctl -C -t short 说明：前台检测硬盘，消耗时间短； smartctl -C -t long 说明:前台检测硬盘，消耗时间长。其实就是利用硬盘SMART的自检程序。 smartctl -X 说明:中断后台检测硬盘。 smartctl -l selftest 说明：显示硬盘检测日志。 smartctl -l error 说明：显示硬盘错误汇总。 smartctl使用实例

如何确定硬盘设备符号？首先通过dmesg工具，确认一下硬盘的设备符号。例如一个IDE硬盘连接到Primary IDE 总线上的Slave位置，硬盘设备符号是/dev/hdb，hdb中的h代表IDE，如果显示为sdb，则代表SATA和SCSI，最后一个字幕b代表Primary总线，第二块硬盘即Slave位置，确认硬盘是否打开了SMART支持：

# smartctl -i /dev/sda smartctl 5.40 2010-10-16 r3189 [i386-redhat-linux-gnu] (local build) Copyright (C) 2002-10 by Bruce Allen, http://smartmontools.sourceforge.net === START OF INFORMATION SECTION === Device Model: HITACHI HTS543225L9SA00 Serial Number: 090131FB2F32YLG28JEA Firmware Version: FBEZC48C User Capacity: 250,059,350,016 bytes Device is: Not in smartctl database [for details use: -P showall] ATA Version is: 8 ATA Standard is: ATA-8-ACS revision 3f Local Time is: Wed May 25 10:10:39 2011 CST SMART support is: Available - device has SMART capability. SMART support is: Enabled //表示启用了smart支持

如果看到SMART support is: Disabled表示SMART未启用，执行如下命令，启动SMART

# smartctl --smart=on --offlineauto=on --saveauto=on /dev/sda smartctl 5.40 2010-10-16 r3189 [i386-redhat-linux-gnu] (local build) Copyright (C) 2002-10 by Bruce Allen, http://smartmontools.sourceforge.net === START OF ENABLE/DISABLE COMMANDS SECTION === SMART Enabled. SMART Attribute Autosave Enabled. SMART Automatic Offline Testing Enabled every four hours.

现在硬盘的SMART功能已经被打开，执行如下命令查看硬盘的健康状况

# smartctl -H /dev/sda smartctl 5.40 2010-10-16 r3189 [i386-redhat-linux-gnu] (local build) Copyright (C) 2002-10 by Bruce Allen, http://smartmontools.sourceforge.net === START OF READ SMART DATA SECTION === SMART overall-health self-assessment test result: PASSED

请注意result后边的结果：PASSED，这表示硬盘健康状态良好；如果这里显示FAILED，那么最好立刻给服务器更换硬盘。SMART只能报告磁盘已经不再健康，但是报警后还能继续运行多久是不确定的。通常，SMART报警参数是有预留的，磁盘报警后，不会当场坏掉，一般能坚持一段时间，有的硬盘SMART报警后还继续跑了好几年，有的硬盘SMART报错后几天就坏了。但是一旦出现报警，侥幸心里是万万不能的…… 如果需要定期登录到服务器上运行smartctl比较麻烦时，linux还提供了系统进程smartd，编辑配置文件：

vi /etc/smartd.conf

这个配置文件中大部分可能是注释掉的说明，只需要写入和当前硬盘相关的配置即可：

/dev/sda -H -m [email protected] 说明：监控磁盘的健康状态,当SMART中报告 PASSED的时候不理睬。一旦出现 Failure，立刻用邮件通知用户指定的邮箱 /dev/sda -a -m [email protected],root@localhost 说明：监控磁盘的所有属性,当SMART中报告 PASSED的时候不理睬。一旦出现 Failure，立刻用邮件通知用户指定的邮箱 /dev/twa0 -d 3ware,0 -a -s L/../../7/00 说明：监控3ware 9000控制器上的第一个ATA磁盘的所有属性,在每个礼拜天的00:00--01:00进行长格式的自我检测 /dev/sg2 -d areca,1 -a -s L/../(01|15)/./22 说明：监控Areca Raid控制器上的第一个SATA磁盘的所有属性,在每个礼拜月的第1天和第15天的22:00--23:00进行长格式的自我检测 -s (O/../.././(00|06|12|18)|S/../.././01|L/../../6/03) 说明：在每天的00:00,06:00,12:00,18:00进行离线的自检，并在每天的01:00-02:00进行短格式的自检，并在每个礼拜6的03:00-04:00进行长格式的自检 /etc/init.d/smartd restart 说明：配置好 smartd.conf后需执行以下命令即可生效

其他和smartd.conf相关的配置可参见: http://smartmontools.sourceforge.net/man/smartd.conf.5.html

【本文地址】

公司简介

联系我们