我的 NAS 盒中有 6 个硬盘。其中两个是 Seagate,它们在出现错误时会返回较高的 RAW_VALUES;见下文。
我的其他驱动器显示的值要低得多。
这是否值得警惕?还是希捷的报告方式就是如此?
看看Raw_Read_Error_Rate
和Seek_Error_Rate
:
# smartctl -a /dev/ada1
=== START OF INFORMATION SECTION ===
Device Model: ST3000DM001-9YN166
Serial Number: W1F09S26
LU WWN Device Id: 5 000c50 0456076fc
Firmware Version: CC4C
User Capacity: 3,000,592,982,016 bytes [3.00 TB]
Sector Sizes: 512 bytes logical, 4096 bytes physical
Device is: Not in smartctl database [for details use: -P showall]
ATA Version is: 8
ATA Standard is: ATA-8-ACS revision 4
Local Time is: Sat Aug 18 17:34:24 2012 EDT
SMART support is: Available - device has SMART capability.
SMART support is: Enabled
=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED
General SMART Values:
Offline data collection status: (0x82) Offline data collection activity
was completed without error.
Auto Offline Data Collection: Enabled.
Self-test execution status: ( 249) Self-test routine in progress...
90% of test remaining.
Total time to complete Offline
data collection: ( 575) seconds.
Offline data collection
capabilities: (0x7b) SMART execute Offline immediate.
Auto Offline data collection on/off support.
Suspend Offline collection upon new
command.
Offline surface scan supported.
Self-test supported.
Conveyance Self-test supported.
Selective Self-test supported.
SMART capabilities: (0x0003) Saves SMART data before entering
power-saving mode.
Supports SMART auto save timer.
Error logging capability: (0x01) Error logging supported.
General Purpose Logging supported.
Short self-test routine
recommended polling time: ( 1) minutes.
Extended self-test routine
recommended polling time: ( 255) minutes.
Conveyance self-test routine
recommended polling time: ( 2) minutes.
SCT capabilities: (0x3085) SCT Status supported.
SMART Attributes Data Structure revision number: 10
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED WHEN_FAILED RAW_VALUE
1 Raw_Read_Error_Rate 0x000f 111 099 006 Pre-fail Always - 34053632
3 Spin_Up_Time 0x0003 093 092 000 Pre-fail Always - 0
4 Start_Stop_Count 0x0032 100 100 020 Old_age Always - 32
5 Reallocated_Sector_Ct 0x0033 100 100 036 Pre-fail Always - 0
7 Seek_Error_Rate 0x000f 060 055 030 Pre-fail Always - 21480133713
9 Power_On_Hours 0x0032 097 097 000 Old_age Always - 2696
10 Spin_Retry_Count 0x0013 100 100 097 Pre-fail Always - 0
12 Power_Cycle_Count 0x0032 100 100 020 Old_age Always - 32
183 Runtime_Bad_Block 0x0032 100 100 000 Old_age Always - 0
184 End-to-End_Error 0x0032 100 100 099 Old_age Always - 0
187 Reported_Uncorrect 0x0032 100 100 000 Old_age Always - 0
188 Command_Timeout 0x0032 100 100 000 Old_age Always - 0
189 High_Fly_Writes 0x003a 100 100 000 Old_age Always - 0
190 Airflow_Temperature_Cel 0x0022 064 061 045 Old_age Always - 36 (Min/Max 34/38)
191 G-Sense_Error_Rate 0x0032 100 100 000 Old_age Always - 0
192 Power-Off_Retract_Count 0x0032 100 100 000 Old_age Always - 28
193 Load_Cycle_Count 0x0032 100 100 000 Old_age Always - 63
194 Temperature_Celsius 0x0022 036 040 000 Old_age Always - 36 (0 19 0 0)
197 Current_Pending_Sector 0x0012 100 100 000 Old_age Always - 0
198 Offline_Uncorrectable 0x0010 100 100 000 Old_age Offline - 0
199 UDMA_CRC_Error_Count 0x003e 200 200 000 Old_age Always - 0
240 Head_Flying_Hours 0x0000 100 253 000 Old_age Offline - 43748536879750
241 Total_LBAs_Written 0x0000 100 253 000 Old_age Offline - 2867098636991
242 Total_LBAs_Read 0x0000 100 253 000 Old_age Offline - 17478042509157
SMART Error Log Version: 1
No Errors Logged
SMART Self-test log structure revision number 1
Num Test_Description Status Remaining LifeTime(hours) LBA_of_first_error
# 1 Extended offline Self-test routine in progress 90% 2696 -
SMART Selective self-test log data structure revision number 1
SPAN MIN_LBA MAX_LBA CURRENT_TEST_STATUS
1 0 0 Not_testing
2 0 0 Not_testing
3 0 0 Not_testing
4 0 0 Not_testing
5 0 0 Not_testing
Selective self-test flags (0x0):
After scanning selected spans, do NOT read-scan remainder of disk.
If Selective self-test is pending on power-up, resume after 0 minute delay.
答案1
我发现自我测试结果非常可靠,并且它们是不言自明的(最后一次运行失败或通过)。
各种供应商特定的属性就是这样。实际上没有标准化的方式来解释它们(这就是为什么 smartmon 工具维护一个驱动器数据库,其中包含对这些值的解释)。您可以在此处找到许多标志含义的描述:https://en.wikipedia.org/wiki/Self-Monitoring,_Analysis_and_Reporting_Technology#Known_ATA_S.MART_attributes
该线SMART overall-health self-assessment test result: PASSED
来自于其下方打印的值,经过转换、标准化,并由驱动器数据库给出阈值。
对于标准化值,通常越低越好,但并非所有标志都表明它们本身预示着机械故障(具有阈值的标志更有可能如此)。诸如无法纠正的读取错误、旋转故障等都是可能的指标。
从这些结果来看,您的驾驶状况良好。
答案2
Seagate 使用 SER(寻道错误率)对两个不同的计数器进行编码:16 个高权重位用于寻道错误计数,32 个低权重位用于寻道计数。您最好使用十六进制显示来简化这两个计数器的读取(6 个半字节 = 2 个错误计数 + 4 个寻道计数)。
RRER(Raw_Read_Error_Rate)不显示增量计数器,而是显示类似-10 log(错误扇区数/磁盘上的总位数),这说明存在最小值和最大值。保持在最大值附近更好。
这里有更多解释:http://www.users.on.net/~fzabkar/HDD/Seagate_SER_RRER_HEC.html
答案3
我的盒子上的手册页smartctl
提供了其中一位作者的链接Linux Journal 上的文章;特别是,清单 3 解释了 的输出smartctl -a
。
尽管它已经有十多年的历史了,但读过之后我发现它仍然具有现实意义并提供了权威的解释。
答案4
我所做的是检查读取 hwecc 和寻道错误率。我还检查以确保不存在重新定位或待处理的扇区。在获得前 3 个扇区的数量后,我会对驱动器进行大量复制,然后再次检查数量。如果它们没有大幅增加,我会密切关注驱动器。如果它们猛增,我会打电话给供应商,看看要做什么才能获得 rma。
我有一个 3 年的旧硬盘,有 23441590 读取错误、206428348 寻道和 27659067 ecc。顺便说一下,这是开机 24 小时后的结果。而我 5.5 年的旧硬盘有 0 0 687123415 ecc。智能故障是一种可靠的早期预警系统,但可以使用这些数字来监视硬盘。我见过的硬盘中,很少有硬盘在故障发生前具有智能预测故障功能。另外,仅供参考,我 3 年的旧硬盘是希捷,5 年的旧硬盘是三星,希捷运行起来很热 :/ 我目前运行的所有希捷都有很多错误,而我的大多数其他品牌都没有。
要做的另一件事是偶尔对驱动器进行基准测试。hdd tune 是 Windows 的一个很好的例子。如果您在没有交换文件或从图表启动的驱动器上运行它,可以告诉您是否有任何区域存在读取问题。现代驱动器的读取率通常从 50mb+ 逐步下降到 25 mb 左右。如果突然下降,则很可能是该区域存在薄弱或坏扇区。如果您每月或每 3 个月对驱动器进行一次基准测试,那么如果突然发生某些事情,您就可以很好地知道。D4xx 纬度就是一个很好的例子。当驱动器控制器开始出现故障时,读取速率将从 5mb 左右开始,偶尔会飙升至 10mb 以上,因此我们一直让这些驱动器处于 rma'd 状态。您可能必须从 bartpe 磁盘或类似磁盘启动,以确保在测试时没有其他东西使用该驱动器。
我经常使用这些结果加上硬盘调整等来在驱动器完全损坏之前获得 rma。