
我家那块西数红盘WD30EFRX,在NAS里跑了五年两个月,通电两万四千小时,去年秋天下的岗。事后复盘日志,它其实从春天就开始给我递话了,异响、掉速、休眠变差,一路被我当成「老盘都这样」硬扛过去,直到后台弹出健康告警才慌。这篇把我错过的信号和SMART数字怎么读一次讲透,你家的盘要是也有下面这些苗头,别学我。
先说清楚:机械盘是拖坏的,不是猝死的
很多人对硬盘坏的概念还停留在「昨天还好好的今天突然认不出了」。机械盘确实有这么死的——磁头撞盘片或者马达卡死,一秒走人,但这种纯属彩票。绝大多数盘的死法是拖:盘片表面某个点磁性衰减了,读写到那得反复重试,这就是坏道的萌芽;然后这个点周边越拖越大,重试越来越频繁,某天磁头在这个区域实在读不出来,固件直接把数据搬到备用扇区并标记这块别用了——这个动作叫重映射。坏道从萌芽到扩散到「重映射也救不回来」,通常以月为单位,窗口期就是留给你的逃生时间。
我的红盘就是这个节奏。三月份第一次咔哒响,六月份拷文件开始卡,九月底SMART告警,十月中旬做短测直接失败。回头看,小半年的缓冲期全被我用来心存侥幸了。
五个信号,我错过前三个
按出现顺序排,前三个最容易被忽略:
信号一:偶发的咔哒声。不是硬盘正常读写的那种细碎滋滋声,是「咔—哒」一下、间隔几秒再来一下的闷响,官方叫磁头归位异响。夜深人静时最好认,贴着机箱听。偶尔一两次不算事,频率越来越高就要警惕。我三月份听到的时候还以为是机箱共振,拿本书垫了垫完事。
信号二:传输速度断崖式抖动。拷大文件本来稳在180MB/s,突然掉到几MB/s甚至归零,转几秒又恢复,全程像心电图。这是磁头在坏道区域反复重试的直接表现。注意跟网络原因的传输慢区分开:网络慢是稳定地慢,千兆口就是110MB/s上不去但不会归零;坏道是忽快忽慢。我六月份第一次遇到还重启了交换机,方向全错。
信号三:休眠越来越难睡。盘上有坏道时,系统后台的巡检和重试动作会变多,表现出来就是原本调好的硬盘休眠突然又睡不踏实了。我家那阵子休眠失败我还去查Docker,查了一晚上容器一无所获,其实那会儿SMART的待定扇区已经从0变4了。
信号四:后台健康告警。飞牛的存储管理、群晖的存储管理器都会在SMART异常时弹通知,群晖还会发邮件。走到这一步说明系统已经替你读过一轮数字了,别点掉就完事,这是明牌。
信号五:冷启动认盘慢或者掉盘。重启NAS后这块盘要多转十几秒才认出来,偶尔干脆认不出再重启又好了。到这份上就是倒计时了,我收到告警后一周就遇到了。
真正硬的证据:SSH进去看SMART五项
耳朵和体感都只是线索,数字才是证据。飞牛开SSH、群晖同样,跑这条:
smartctl -a /dev/sda
输出几十项,别慌,真正值得盯的就五项,我按重要程度排:
| 指标 | 含义 | 怎么看 |
| Current_Pending_Sector | 待定扇区,读不出来等着重映射的量 | raw值非0就是红牌,我最红时17 |
| Reallocated_Sector_Ct | 已重映射扇区数 | 0最好;非0要盯趋势,只涨不降 |
| Power_On_Hours | 累计通电小时 | 5万小时以上算高龄,加强巡检 |
| UDMA_CRC_Error | 数据线传输出错 | 非0先换SATA线,大概率不是盘 |
| Temperature | 盘体温度 | 常年45度以上折寿,理想40度以下 |
两个容易踩的坑说一下。一是raw_value那列才是原始值,有些盘用十六进制存,看到1000别吓着,换算一下可能就是16。二是UDMA_CRC这一项冤枉了很多好盘——它统计的是线缆传输错误,拔插一下SATA线或者换根线,这个数字就不再涨了,别一看非0就下单买盘。
光看数字还不放心,可以主动跑个短测,两三分钟出结果:
smartctl -t short /dev/sda
跑完用 smartctl -a 看结果段落,PASS就是当前读得动,FAIL基本可以准备后事了。我的盘就是短测FAIL之后一周内冷启动掉盘的,这个测试对坏道的嗅觉比人耳灵。
查出问题了怎么办:先备份,再决定换不换
顺序千万别反。我见过太多人反过来——先研究换哪块新盘,下单等快递的那几天里盘彻底咽气,这种故事每年贴吧都有。正确顺序是:
第一步,立刻备份。不管三七二十一,把这块盘上没法重新下载的东西先按备份的门道抄去别处。坏道扩散期的盘,每一次全盘扫描都是催命,拷贝时挑最重要的先来,别从第一个文件夹开始慢慢磨。我那块盘咽气前最后拷出去的是家庭照片和文档,影视库存了三百多G的蓝光原盘直接放弃——那些东西重新下载就是了。
第二步,评估要不要换。Pending非0或者短测FAIL,没得商量,换。Reallocated只有个位数且几个月不涨,温度和声音都正常,可以再观察,但巡检频率提到一月一次。高龄盘(通电5万小时以上)哪怕数字干净,也建议列进换盘计划,别等它跟 RAID 里的另一块一起老。
第三步,换盘。组了RAID的直接插新盘进重建,注意别两块一起换,重建那几十个小时是剩下的老盘压力最大的时段,详见我写RAID怎么选那篇里的重建时间账。没组RAID的单盘更简单,新盘上位、数据拷回、旧盘退役。买新盘时候的盘位和容量账可以翻翻我算两盘位四盘位那篇,别又买小了。
让盘活得久,平时做好三件事
事后我复盘,我那块红盘其实伺候得不算差,但有三件事能做得更好,也给各位提个醒:
降温。机械盘的寿命对温度最敏感,常年45度往上跑的盘坏道出得早。我后来加了机箱风扇把盘温压到38度上下,成本二十块。盘位挤在一起叠罗汉装的最容易积热,能隔一格装一格。
扫描和重活挪凌晨。全盘巡检、SMART长测这种让磁头全盘跑一圈的动作,放在凌晨占用最低的时段干,跟我把任务挪凌晨省电费是一个思路——既不耽误白天用,也让盘的作息规律点。
别频繁启停,也别怕启停。一天启停十几次的折腾盘和七年不关机的工作盘都不可取,按使用节奏设个合理的休眠就好。另外电源质量也上点心,我家停电比较勤,后来配了UPS,电压不稳对硬盘是隐形杀手。
收尾说句公道话:机械盘其实挺结实的,两万四千小时才咽气、咽气前给了半年预警,比很多人想象中靠谱。真正的不靠谱是人的侥幸心理。一个月花两分钟跑一次smartctl,把数字截图存着对比趋势,这五个信号一个都漏不掉。数据无价,盘是有价的,想明白这个顺序,NAS这事儿就稳了。

发表评论