Метрики дисков в Prometheus

Метрики дисков в Prometheus#

Сервис Prometheus хранит следующие метрики дисков.

Метрики CS:

csd_io_op_time_seconds

Среднее время на запрос ввода-вывода.

master:mdsd_cs_status

Статус CS в главном MDS

Метрики диска из **/proc/diskstats:

node_disk_read_time_seconds

Общее время в секундах, затраченное на запросы чтения

node_disk_reads_completed

Общее количество завершенных запросов на чтение

node_disk_write_time_seconds

Общее время в секундах, затраченное на запросы на запись

node_disk_writes_completed

Общее количество завершенных запросов на запись

Метрики S.M.A.R.T.

smart_device_smart_healthy

Показывает, работоспособен ли диск согласно данным S.M.A.R.T.

smart_reallocated_sector_ct

Общее количество переназначенных секторов (05)

smart_reported_uncorrect

Общее количество ошибок, которые нельзя исправить средствами ECC (187)

smart_command_timeout

Общее количество операций, отмененных из-за превышения времени ожидания (188)

smart_current_pending_sector

Общее количество нестабильных секторов (197)

smart_offline_uncorrectable

Общее количество неисправляемых ошибок при чтении/записи сектора (198)

smart_media_wearout_indicator

Индикатор износа диска SSD (233)

smart_nvme_intel_wear_leveling

Индикатор износа диска Intel NVME (233)

smart_scsi_read_errors_uncorrected

Общее количество неисправляемых ошибок при чтении сектора

smart_scsi_reallocated_sector_ct

Общее количество переназначенных секторов диска

smart_scsi_verify_errors_uncorrected

Общее количество неисправляемых ошибок при проверке сектора

smart_scsi_write_errors_uncorrected

Общее количество неисправляемых ошибок при записи сектора

Ошибки SCSI согласно данным ядра ОС:

kernel_scsi_failures_total

Общее количество сбоев SCSI согласно полученным от ядра ОС данным

Метрики состояния диска от vstorage-disks-monitor:

diskmon_cs_disk_health

Состояние диска согласно данным, полученным от службы vstorage-disks-monitor. Возможные значения — 0.0–1.0. Значение 1.0 означает, что диск полностью работоспособен.