Накопители NVMe
$ apt install nvme-cli smartmontools
$ nvme smart-log /dev/nvme0- Значение critical_warning должно быть равно 0.
- percentage_used — индикатор износа; накопители серверного класса рассчитаны на интенсивную запись, но за динамикой стоит следить.
- Значение media_errors должно оставаться равным 0.
- Значение available_spare должно оставаться выше порогового.
Жёсткие диски
$ smartctl -a /dev/sdaСледите за четырьмя атрибутами: Reallocated_Sector_Ct, Current_Pending_Sector, Offline_Uncorrectable (в идеале у всех трёх — 0) и UDMA_CRC_Error_Count (рост значения указывает на проблему с кабелем или бэкплейном).
Самотестирование
$ smartctl -t long /dev/sda # hours on large drives
$ smartctl -l selftest /dev/sda # read the result laterКогда открывать тикет
При любом неудачном самотестировании, ненулевом значении critical warning, росте числа переназначенных или ожидающих переназначения секторов, а также если диск выпадает из массива. Приложите вывод smartctl или nvme smart-log: так мы сможем заменить диск в течение 2 часов без дополнительной диагностики.



