了解 smartctl -a 输出

了解 smartctl -a 输出

我的 NAS 盒中有 6 个硬盘。其中两个是 Seagate,它们在出现错误时会返回较高的 RAW_VALUES;见下文。

我的其他驱动器显示的值要低得多。

这是否值得警惕?还是希捷的报告方式就是如此?

看看Raw_Read_Error_RateSeek_Error_Rate

# smartctl -a /dev/ada1
=== START OF INFORMATION SECTION ===
Device Model:     ST3000DM001-9YN166
Serial Number:    W1F09S26
LU WWN Device Id: 5 000c50 0456076fc
Firmware Version: CC4C
User Capacity:    3,000,592,982,016 bytes [3.00 TB]
Sector Sizes:     512 bytes logical, 4096 bytes physical
Device is:        Not in smartctl database [for details use: -P showall]
ATA Version is:   8
ATA Standard is:  ATA-8-ACS revision 4
Local Time is:    Sat Aug 18 17:34:24 2012 EDT
SMART support is: Available - device has SMART capability.
SMART support is: Enabled

=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED

General SMART Values:
Offline data collection status:  (0x82) Offline data collection activity
                    was completed without error.
                    Auto Offline Data Collection: Enabled.
Self-test execution status:      ( 249) Self-test routine in progress...
                    90% of test remaining.
Total time to complete Offline 
data collection:        (  575) seconds.
Offline data collection
capabilities:            (0x7b) SMART execute Offline immediate.
                    Auto Offline data collection on/off support.
                    Suspend Offline collection upon new
                    command.
                    Offline surface scan supported.
                    Self-test supported.
                    Conveyance Self-test supported.
                    Selective Self-test supported.
SMART capabilities:            (0x0003) Saves SMART data before entering
                    power-saving mode.
                    Supports SMART auto save timer.
Error logging capability:        (0x01) Error logging supported.
                    General Purpose Logging supported.
Short self-test routine 
recommended polling time:    (   1) minutes.
Extended self-test routine
recommended polling time:    ( 255) minutes.
Conveyance self-test routine
recommended polling time:    (   2) minutes.
SCT capabilities:          (0x3085) SCT Status supported.

SMART Attributes Data Structure revision number: 10
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000f   111   099   006    Pre-fail  Always       -       34053632
  3 Spin_Up_Time            0x0003   093   092   000    Pre-fail  Always       -       0
  4 Start_Stop_Count        0x0032   100   100   020    Old_age   Always       -       32
  5 Reallocated_Sector_Ct   0x0033   100   100   036    Pre-fail  Always       -       0
  7 Seek_Error_Rate         0x000f   060   055   030    Pre-fail  Always       -       21480133713
  9 Power_On_Hours          0x0032   097   097   000    Old_age   Always       -       2696
 10 Spin_Retry_Count        0x0013   100   100   097    Pre-fail  Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   020    Old_age   Always       -       32
183 Runtime_Bad_Block       0x0032   100   100   000    Old_age   Always       -       0
184 End-to-End_Error        0x0032   100   100   099    Old_age   Always       -       0
187 Reported_Uncorrect      0x0032   100   100   000    Old_age   Always       -       0
188 Command_Timeout         0x0032   100   100   000    Old_age   Always       -       0
189 High_Fly_Writes         0x003a   100   100   000    Old_age   Always       -       0
190 Airflow_Temperature_Cel 0x0022   064   061   045    Old_age   Always       -       36 (Min/Max 34/38)
191 G-Sense_Error_Rate      0x0032   100   100   000    Old_age   Always       -       0
192 Power-Off_Retract_Count 0x0032   100   100   000    Old_age   Always       -       28
193 Load_Cycle_Count        0x0032   100   100   000    Old_age   Always       -       63
194 Temperature_Celsius     0x0022   036   040   000    Old_age   Always       -       36 (0 19 0 0)
197 Current_Pending_Sector  0x0012   100   100   000    Old_age   Always       -       0
198 Offline_Uncorrectable   0x0010   100   100   000    Old_age   Offline      -       0
199 UDMA_CRC_Error_Count    0x003e   200   200   000    Old_age   Always       -       0
240 Head_Flying_Hours       0x0000   100   253   000    Old_age   Offline      -       43748536879750
241 Total_LBAs_Written      0x0000   100   253   000    Old_age   Offline      -       2867098636991
242 Total_LBAs_Read         0x0000   100   253   000    Old_age   Offline      -       17478042509157

SMART Error Log Version: 1
No Errors Logged

SMART Self-test log structure revision number 1
Num  Test_Description    Status                  Remaining  LifeTime(hours)  LBA_of_first_error
# 1  Extended offline    Self-test routine in progress 90%      2696         -

SMART Selective self-test log data structure revision number 1
 SPAN  MIN_LBA  MAX_LBA  CURRENT_TEST_STATUS
    1        0        0  Not_testing
    2        0        0  Not_testing
    3        0        0  Not_testing
    4        0        0  Not_testing
    5        0        0  Not_testing
Selective self-test flags (0x0):
  After scanning selected spans, do NOT read-scan remainder of disk.
If Selective self-test is pending on power-up, resume after 0 minute delay.

答案1

我发现自我测试结果非常可靠,并且它们是不言自明的(最后一次运行失败或通过)。

各种供应商特定的属性就是这样。实际上没有标准化的方式来解释它们(这就是为什么 smartmon 工具维护一个驱动器数据库,其中包含对这些值的解释)。您可以在此处找到许多标志含义的描述:https://en.wikipedia.org/wiki/Self-Monitoring,_Analysis_and_Reporting_Technology#Known_ATA_S.MART_attributes

该线SMART overall-health self-assessment test result: PASSED来自于其下方打印的值,经过转换、标准化,并由驱动器数据库给出阈值。

对于标准化值,通常越低越好,但并非所有标志都表明它们本身预示着机械故障(具有阈值的标志更有可能如此)。诸如无法纠正的读取错误、旋转故障等都是可能的指标。

从这些结果来看,您的驾驶状况良好。

答案2

Seagate 使用 SER(寻道错误率)对两个不同的计数器进行编码:16 个高权重位用于寻道错误计数,32 个低权重位用于寻道计数。您最好使用十六进制显示来简化这两个计数器的读取(6 个半字节 = 2 个错误计数 + 4 个寻道计数)。

RRER(Raw_Read_Error_Rate)不显示增量计数器,而是显示类似-10 log(错误扇区数/磁盘上的总位数),这说明存在最小值和最大值。保持在最大值附近更好。

这里有更多解释:http://www.users.on.net/~fzabkar/HDD/Seagate_SER_RRER_HEC.html

答案3

我的盒子上的手册页smartctl提供了其中一位作者的链接Linux Journal 上的文章;特别是,清单 3 解释了 的输出smartctl -a

尽管它已经有十多年的历史了,但读过之后我发现它仍然具有现实意义并提供了权威的解释。

答案4

我所做的是检查读取 hwecc 和寻道错误率。我还检查以确保不存在重新定位或待处理的扇区。在获得前 3 个扇区的数量后,我会对驱动器进行大量复制,然后再次检查数量。如果它们没有大幅增加,我会密切关注驱动器。如果它们猛增,我会打电话给供应商,看看要做什么才能获得 rma。

我有一个 3 年的旧硬盘,有 23441590 读取错误、206428348 寻道和 27659067 ecc。顺便说一下,这是开机 24 小时后的结果。而我 5.5 年的旧硬盘有 0 0 687123415 ecc。智能故障是一种可靠的早期预警系统,但可以使用这些数字来监视硬盘。我见过的硬盘中,很少有硬盘在故障发生前具有智能预测故障功能。另外,仅供参考,我 3 年的旧硬盘是希捷,5 年的旧硬盘是三星,希捷运行起来很热 :/ 我目前运行的所有希捷都有很多错误,而我的大多数其他品牌都没有。

要做的另一件事是偶尔对驱动器进行基准测试。hdd tune 是 Windows 的一个很好的例子。如果您在没有交换文件或从图表启动的驱动器上运行它,可以告诉您是否有任何区域存在读取问题。现代驱动器的读取率通常从 50mb+ 逐步下降到 25 mb 左右。如果突然下降,则很可能是该区域存在薄弱或坏扇区。如果您每月或每 3 个月对驱动器进行一次基准测试,那么如果突然发生某些事情,您就可以很好地知道。D4xx 纬度就是一个很好的例子。当驱动器控制器开始出现故障时,读取速率将从 5mb 左右开始,偶尔会飙升至 10mb 以上,因此我们一直让这些驱动器处于 rma'd 状态。您可能必须从 bartpe 磁盘或类似磁盘启动,以确保在测试时没有其他东西使用该驱动器。

我经常使用这些结果加上硬盘调整等来在驱动器完全损坏之前获得 rma。

相关内容