Мониторинг журналов событий#
С помощью команды vstorage -c <cluster_name> top можно вести мониторинг важных событий, происходящих в кластере хранения данных, например:
Приведенная выше команда отображает последние события, которые произошли в кластере stor1. Сведения о событиях (выделены красным) отображаются в таблице со следующими столбцами:
TIMEВремя события.
SYSКомпонент кластера, в котором произошло событие (например, MDS для сервера метаданных или JRN для локального журнала).
SEVУровень серьезности события.
MESSAGEОписание события.
В следующей таблице перечислены основные события, отображаемые при запуске утилиты vstorage top.
Событие |
Серьезность |
Описание |
|---|---|---|
MDS#<N> (<addr>:<port>) lags behind for more than 1000 rounds (Сервер MDS № <N> отстает в течение более 1000 циклов) |
JRN err (Ошибка журнала) |
Создается главным сервером MDS, когда тот обнаруживает устаревание/отставание сервера MDS № <N>. Это сообщение может указывать на то, что какой-то сервер MDS работает очень медленно и не успевает обрабатывать операции. |
MDS#<N> (<addr>:<port>) didn’t accept commits for M sec (Сервер MDS № <N> не принимал фиксации в течение M сек.) |
JRN err (Ошибка журнала) |
Создается главным сервером MDS, если сервер MDS № <N> не принимал фиксаций в течение M сек. Такой сервер MDS № <N> помечается как устаревший. Это сообщение может указывать, что на сервере MDS № <N> возникли проблемы со службой MDS. Такая проблема может быть критической, и ее следует решить как можно скорее. |
MDS#<N> (<addr>:<port>) state is outdated and will do a full resync (Состояние сервера MDS № <N> устарело, будет произведена полная повторная синхронизация) |
JRN err (Ошибка журнала) |
Создается главным сервером MDS, если на сервере MDS № <N> будет проведена полная повторная синхронизация. Такой сервер MDS № <N> помечается как устаревший. Это сообщение может указывать, что определенный сервер MDS работал слишком медленно или соединение с ним нарушилось на такое продолжительное время, что он уже не поддерживает актуального состояния метаданных и его необходимо синхронизировать повторно. Такая проблема может быть критической, и ее следует решить как можно скорее. |
MDS#<N> at <addr>:<port> became master (Сервер MDS № <N> стал главным сервером) |
JRN info (Информация в журнале) |
Создается каждый раз, когда в кластере выбирается новый главный сервер MDS. Частые изменения главного сервера MDS могут указывать на проблемы с сетевыми подключениями и негативно влиять на работу кластеров. |
The cluster is healthy with N active CS (Кластер работоспособен с N активных CS) |
MDS info (Информация MDS) |
Создается в случае, если состояние кластера меняется на работоспособное, и при выборе нового главного сервера MDS. Это сообщение указывает, что все серверы фрагментов в кластере активны и количество реплик соответствует установленным в кластере требованиям. |
The cluster is degraded with N active, M inactive, K offline CS (Кластер деградировал: N активных серверов фрагментов, M неактивных, K отключены) |
MDS warn (Предупреждение MDS) |
Создается, когда состояние кластера меняется на деградировавшее, а также при выборе нового главного сервера MDS. Это сообщение указывает,
что некоторые серверы
фрагментов в кластере либо
неактивны, то есть не
посылают каких-либо
сообщений о регистрации,
либо отключены, то есть
были неактивны дольше, чем
задано в параметре
|
The cluster failed with N active, M inactive, K offline CS (mds.wd.max_offline_cs=<n>) (Произошел отказ кластера: N активных серверов фрагментов данных, M неактивных, K отключены) |
MDS err (Ошибка MDS) |
Создается, когда состояние кластера меняется на отказ кластера, а также при выборе нового главного сервера MDS. Это сообщение указывает,
что количество отключенных
серверов фрагментов данных
превышает число, заданное
в параметре
|
The cluster is filled up to <N>% (Кластер заполнен на <N> %) |
MDS info/warn (Информация/предупреждение MDS) |
Уведомляет о текущем использовании пространства в кластере. Если израсходовано 80 % и более дискового пространства, формируется предупреждение. Важно иметь некоторый резервный объем дискового пространства для реплик данных на случай отказа одного из серверов фрагментов данных. |
Replication started, N chunks are queued (Репликация начата, в очередь помещено N фрагментов) |
MDS info (Информация MDS) |
Создается, когда кластер начинает автоматическую репликацию данных для восстановления отсутствующих реплик. |
Replication completed (Репликация завершена) |
MDS info (Информация MDS) |
Создается, когда кластер завершает автоматическую репликацию данных. |
CS#<N> has reported hard error on path (CS № <N> сообщил об аппаратной ошибке по пути *path*) |
MDS warn (Предупреждение MDS) |
Создается, когда CS № <N> обнаруживает повреждение данных на диске. Рекомендуется проверить оборудование на предмет ошибок и заменить диски с поврежденными данными как можно скорее. |
CS#<N> has not registered during the last T sec and is marked as inactive/offline (CS № <N> не проходил регистрацию в течение последних T секунд и помечен как неактивный/отключенный) |
MDS warn (Предупреждение MDS) |
Создается, когда CS № <N> был недоступен в течение некоторого времени. Через 5 минут его состояние меняется на отключенный (offline), при этом запускается автоматическая репликация данных для восстановления реплик, хранившихся на сервере фрагментов данных, который оказался отключен. |
Failed to allocate N replicas for ‘path’ by request from <addr>:<port> - K out of M chunks servers are available (Не удалось распределить N реплик для пути 'path' по запросу от <addr>:<port> — K из M серверов фрагментов данных недоступны) |
MDS warn (Предупреждение MDS) |
Создается, когда кластер не может выделить пространство для реплик фрагментов, например в случае, если на нем исчерпалось дисковое пространство. |
Failed to allocate N replicas for ‘path’ by request from <addr>:<port> since only K chunk servers are registered (Не удалось распределить N реплик для пути 'path' по запросу от <addr>:<port>, поскольку зарегистрировано лишь K серверов фрагментов данных) |
MDS warn (Предупреждение MDS) |
Создается, когда кластер не может выделить пространство для реплик фрагментов, потому что в кластере зарегистрировано слишком мало серверов фрагментов данных. |
