Метрики дисков в Prometheus#
Сервис Prometheus хранит следующие метрики дисков.
Метрики CS:
csd_io_op_time_secondsСреднее время на запрос ввода-вывода.
master:mdsd_cs_statusСтатус CS в главном MDS
Метрики диска из **/proc/diskstats:
node_disk_read_time_secondsОбщее время в секундах, затраченное на запросы чтения
node_disk_reads_completedОбщее количество завершенных запросов на чтение
node_disk_write_time_secondsОбщее время в секундах, затраченное на запросы на запись
node_disk_writes_completedОбщее количество завершенных запросов на запись
Метрики S.M.A.R.T.
smart_device_smart_healthyПоказывает, работоспособен ли диск согласно данным S.M.A.R.T.
smart_reallocated_sector_ctОбщее количество переназначенных секторов (05)
smart_reported_uncorrectОбщее количество ошибок, которые нельзя исправить средствами ECC (187)
smart_command_timeoutОбщее количество операций, отмененных из-за превышения времени ожидания (188)
smart_current_pending_sectorОбщее количество нестабильных секторов (197)
smart_offline_uncorrectableОбщее количество неисправляемых ошибок при чтении/записи сектора (198)
smart_media_wearout_indicatorИндикатор износа диска SSD (233)
smart_nvme_intel_wear_levelingИндикатор износа диска Intel NVME (233)
smart_scsi_read_errors_uncorrectedОбщее количество неисправляемых ошибок при чтении сектора
smart_scsi_reallocated_sector_ctОбщее количество переназначенных секторов диска
smart_scsi_verify_errors_uncorrectedОбщее количество неисправляемых ошибок при проверке сектора
smart_scsi_write_errors_uncorrectedОбщее количество неисправляемых ошибок при записи сектора
Ошибки SCSI согласно данным ядра ОС:
kernel_scsi_failures_totalОбщее количество сбоев SCSI согласно полученным от ядра ОС данным
Метрики состояния диска от vstorage-disks-monitor:
diskmon_cs_disk_healthСостояние диска согласно данным, полученным от службы
vstorage-disks-monitor. Возможные значения — 0.0–1.0. Значение 1.0 означает, что диск полностью работоспособен.
См. также