Linux 下用 smartd 监测硬盘状况（转载）

最新推荐文章于 2024-08-31 11:21:50 发布

weixin_34400525

最新推荐文章于 2024-08-31 11:21:50 发布

阅读量139

点赞数

文章标签：操作系统数据库运维

原文链接：http://blog.51cto.com/5580606/1315600

版权

和处理器、内存比较，硬盘是服务器上最慢的子系统、是最容易出现性能瓶颈的地方，也是最脆弱的部分。因为硬盘离处理器距离最远而且访问硬盘要涉及到一些机械操作，比如转轴、寻轨等，而机械是容易出故障的。作为VPS服务商和系统管理员来说，最害怕的就是硬盘出毛病，所以监测硬盘的健康状况、提前预警是件很重要的事情。我们PC服务器上差不多1.5年都会有硬盘坏掉，坏掉前一点征兆都没有，SUN服务器上的情况要好得到，很多SATA/SCSI硬盘运行了5年都没问题，看样子品牌服务器还是贵得有理由的。VPSee前段时间看过Google发表的一篇论文：FailureTrendsinaLargeDiskDrivePopulation也证实了我们的经历，结论是所有坏掉的硬盘中只有60％可以被S.M.A.R.T.检测到，也就是说S.M.A.R.T.的测试结果只有60％是正确的，所以我们还不能完全依赖S.M.A.R.T.的监测结果。

目前市面上所有的硬盘都具有S.M.A.R.T.(Self-Monitoring,AnalysisandReportingTechnology)特性，smartmontools就是利用这一特性监测硬盘的软件包，包含smartctl和smartd两个程序，前者是前台命令行工具、后者是后台运行程序，smartmontools不是Linux的专利，也支持BSD,Solaris等系统。

安装smartmontools

在CentOS/Fedora下安装：

# yum install kernel-utils

在Debian/Ubuntu下安装：

# apt-get install smartmontools

使用smartmontools

在使用smartmontools测试之前先检查一下硬盘是否具有SMART特性：

# smartctl -i /dev/sda

=== START OF INFORMATION SECTION ===
Device Model:     SEAGATE ST32500NSSUN250G 0741B58YP8
Serial Number:    5QE58YP8
Firmware Version: 3.AZK
User Capacity:    250,056,000,000 bytes
Device is:        Not in smartctl database [for details use: -P showall]
ATA Version is:   7
ATA Standard is:  Exact ATA specification draft version not indicated
Local Time is:    Thu Jul 22 22:39:07 2010 SAST
SMART support is: Available - device has SMART capability.
SMART support is: Enabled

如果上面SMARTsupport是Disabled状态的话，需要开启SMART的支持：

# smartctl -s on /dev/sda

=== START OF ENABLE/DISABLE COMMANDS SECTION ===
SMART Enabled.

检查硬盘状况，如果下面的结果不是PASSED的话你需要立刻警觉起来，马上备份所有数据，硬盘随时都可能出问题（不过值得注意的是就算结果是PASSED并不意味着硬盘100％就安全，PASS不能代表没问题，没PASS代表一定有问题）：

# smartctl -H /dev/sda

=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED

做个快速自检：

# smartctl -t short /dev/sda

=== START OF OFFLINE IMMEDIATE AND SELF-TEST SECTION ===
Sending command: "Execute SMART Short self-test routine immediately in off-line mode".
Drive command "Execute SMART Short self-test routine immediately in off-line mode" successful.
Testing has begun.
Please wait 1 minutes for test to complete.
Test will complete after Thu Jul 22 22:51:00 2010

Use smartctl -X to abort test.

执行上面的自检命令后等待一段时间，可以通过下面命令来看进度和结果：

# smartctl -l selftest /dev/sda

=== START OF READ SMART DATA SECTION ===
SMART Self-test log structure revision number 1
Num  Test_Description    Status                  Remaining  LifeTime(hours)  LBA_of_first_error
# 1  Short offline       Completed without error       00%     20949         -
# 2  Short offline       Completed without error       00%     20947         -

要做长时间自检的话（很耗时，建议放在凌晨时间段做）：

# smartctl -t long /dev/sda

查看出错日志：

# smartctl -l error /dev/sda

=== START OF READ SMART DATA SECTION ===
SMART Error Log Version: 1
No Errors Logged

配置smartmontools

在CentOS/Fedora下：

# vi /etc/smartd.conf
# /etc/init.d/smartd restart

在Debian/Ubuntu下：

# vi /etc/default/smartmontools
# vi /etc/smartd.conf
# /etc/init.d/smartmontools restart

可以通过修改以上的smartmontools的配置文件来定期对硬盘做健康检查，就像给人定期体检一样，体检过了并不代表就没病（很多疾病用体检的设备都查不到），所以这也符合Google的硬盘报告所说的情况，所有坏掉的硬盘中只有60％可以被S.M.A.R.T.检测到（所有生病的人中只有60％能在体检的时候发现）。

原文出处：http://www.vpsee.com/2010/07/monitoring-hard-disk-health-with-smartd-under-linux/

转载于:https://blog.51cto.com/5580606/1315600

weixin_34400525

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Linux 下用 smartd 监测硬盘状况（转载）

和处理器、内存比较，硬盘是服务器上最慢的子系统、是最容易出现性能瓶颈的地方，也是最脆弱的部分。因为硬盘离处理器距离最远而且访问硬盘要涉及到一些机械操作，比如转轴、寻轨等，而机械是容易出故障的。作为VPS服务商和系统管理员来说，最害怕的就是硬盘出毛病，所以监测硬盘的健康状况、提前预警是件很重要的事情。我们PC服务器上差不多1.5年都会有硬盘坏掉，坏掉前一点征兆都没有，SUN服务...
复制链接

扫一扫