磁盘健康·硬盘

如何检查硬盘健康状况(不追鬼)

当您视健康为己任时,硬盘哨兵就会大放异彩速度:计数器移动的速度有多快——没有一个绿色徽章。

2026 年 5 月 · ~8 分钟阅读 · 独立教育内容

Disk monitoring scenario illustration for hard drive health checks

1. 盘钻孔时捕获基线

发现“正常情况是什么样子”的最糟糕的时间是在事件发生期间。以最少的后台 IO 进行干净启动后,如果您维护队列,请记录 SMART 快照并导出。该基线成为你的故事弧——突然的偏差比绝对标签更重要。

2.温度是健康的一部分——尤其是对于硬盘而言

与 SSD 相比,机械硬盘在短时间突发情况下的耐热性较差。跟踪持续传输期间的峰值(编码、备份、游戏补丁),而不仅仅是空闲时间。当冷却性能下降时,峰值上升通常先于重新分配活动。

3. 值得关注的 SMART 属性

供应商重命名属性,但模式会重复出现:重新分配/挂起扇区、不可纠正的错误、接口 CRC 错误(通常是电缆/端口问题)以及机械磁盘上​​的寻道错误率。如果只有一种属性发生变化,而其他属性保持不变,则在宣布死亡螺旋之前先怀疑环境原因。

4. 补充空闲监控的自检

简短的测试可以发现明显的缺陷;扩展测试会对盘片施加更长时间的压力 - 在环境温度合理并且机器空闲时安排它们。将结果与之前的运行进行比较,而不是追逐制造商的营销阈值。

5. 何时迁移数据

如果重新分配计数加速、出现轴承噪音或文件系统日志在轻负载期间引发重复错误,请在表面退化蔓延之前克隆到替换介质。监控购买了跑道——备份提供了确定性。

相关阅读

下载