Метрики основного хранилища#
Метрики, используемые для мониторинга основного хранилища, настраиваются в правилах записи Prometheus, и их можно найти в следующих файлах на каждом из узлов в кластере:
/var/lib/prometheus/rules/mdsd.rules/var/lib/prometheus/rules/csd.rules/var/lib/prometheus/rules/fused.rules/var/lib/prometheus/rules/rjournal.rules
Метрики, используемые для создания оповещений по основному хранилищу, добавляются в правила оповещений в файле /var/lib/prometheus/alerts/pcs.rules:
fused_stuck_reqs_30sКоличество запросов ввода-вывода, зависших на узле в течение более чем 30 секунд.
fused_stuck_reqs_10sКоличество запросов ввода-вывода, зависших на узле в течение более чем 10 секунд.
fused_maps_failedКоличество завершившихся сбоем запросов сопоставления на узле.
fused_map_failures_totalОбщее количество завершившихся сбоем запросов сопоставления на узле.
fused_unaligned_writes:rate5mКоличество невыровненных запросов записи в секунду за 5 минут.
fused_writes:rate5mКоличество запросов записи в секунду за 5 минут.
fused_unaligned_reads:rate5mКоличество невыровненных запросов чтения в секунду за 5 минут.
fused_reads:rate5mКоличество запросов чтения в секунду за 5 минут.
mdsd_cluster_replication_stuck_chunksКоличество фрагментов, блокирующих репликацию.
mdsd_cluster_replication_touts_totalОбщее количество фрагментов, замедляющих репликацию.
job:mdsd_fs_chunk_maps:sumКоличество фрагментов в кластере хранилища.
job:mdsd_fs_files:sumКоличество файлов в кластере хранилища.
master:mdsd_cs_statusСтатус сервиса фрагментов данных.
mdsd_cluster_free_space_bytesОбъем свободного физического пространства в кластере хранилища.
mdsd_cluster_space_bytesОбщий объем физического пространства в кластере хранилища.
mdsd_is_masterУзел, на котором выполняется главный сервис метаданных.
mdsd_master_uptimeВремя непрерывной работы главного сервиса метаданных.
instance_le:rjournal_commit_duration_seconds_bucket:rate5mТекущая задержка фиксации для определенного сервиса метаданных в течение 5 минут, для каждой из корзин.
instance_csid:csd_journal_usage_ratio:rate5mПроцент свободного пространства для журнала сервиса фрагментовза 5 минут.
process_cpu_seconds_totalСуммарная длительность времени, в течение которого процесс использовал ЦП.
process_swap_bytesОбъем пространства подкачки, используемого процессом.