Мониторинг журналов событий

Мониторинг журналов событий#

С помощью команды vstorage -c <cluster_name> top можно вести мониторинг важных событий, происходящих в кластере хранения данных, например:

image1

Приведенная выше команда отображает последние события, которые произошли в кластере stor1. Сведения о событиях (выделены красным) отображаются в таблице со следующими столбцами:

TIME

Время события.

SYS

Компонент кластера, в котором произошло событие (например, MDS для сервера метаданных или JRN для локального журнала).

SEV

Уровень серьезности события.

MESSAGE

Описание события.

В следующей таблице перечислены основные события, отображаемые при запуске утилиты vstorage top.

Таблица 25 Основные события#

Событие

Серьезность

Описание

MDS#<N> (<addr>:<port>) lags behind for more than 1000 rounds (Сервер MDS № <N> отстает в течение более 1000 циклов)

JRN err (Ошибка журнала)

Создается главным сервером MDS, когда тот обнаруживает устаревание/отставание сервера MDS № <N>.

Это сообщение может указывать на то, что какой-то сервер MDS работает очень медленно и не успевает обрабатывать операции.

MDS#<N> (<addr>:<port>) didn’t accept commits for M sec (Сервер MDS № <N> не принимал фиксации в течение M сек.)

JRN err (Ошибка журнала)

Создается главным сервером MDS, если сервер MDS № <N> не принимал фиксаций в течение M сек. Такой сервер MDS № <N> помечается как устаревший.

Это сообщение может указывать, что на сервере MDS № <N> возникли проблемы со службой MDS. Такая проблема может быть критической, и ее следует решить как можно скорее.

MDS#<N> (<addr>:<port>) state is outdated and will do a full resync (Состояние сервера MDS № <N> устарело, будет произведена полная повторная синхронизация)

JRN err (Ошибка журнала)

Создается главным сервером MDS, если на сервере MDS № <N> будет проведена полная повторная синхронизация. Такой сервер MDS № <N> помечается как устаревший.

Это сообщение может указывать, что определенный сервер MDS работал слишком медленно или соединение с ним нарушилось на такое продолжительное время, что он уже не поддерживает актуального состояния метаданных и его необходимо синхронизировать повторно. Такая проблема может быть критической, и ее следует решить как можно скорее.

MDS#<N> at <addr>:<port> became master (Сервер MDS № <N> стал главным сервером)

JRN info (Информация в журнале)

Создается каждый раз, когда в кластере выбирается новый главный сервер MDS.

Частые изменения главного сервера MDS могут указывать на проблемы с сетевыми подключениями и негативно влиять на работу кластеров.

The cluster is healthy with N active CS (Кластер работоспособен с N активных CS)

MDS info (Информация MDS)

Создается в случае, если состояние кластера меняется на работоспособное, и при выборе нового главного сервера MDS.

Это сообщение указывает, что все серверы фрагментов в кластере активны и количество реплик соответствует установленным в кластере требованиям.

The cluster is degraded with N active, M inactive, K offline CS (Кластер деградировал: N активных серверов фрагментов, M неактивных, K отключены)

MDS warn (Предупреждение MDS)

Создается, когда состояние кластера меняется на деградировавшее, а также при выборе нового главного сервера MDS.

Это сообщение указывает, что некоторые серверы фрагментов в кластере либо неактивны, то есть не посылают каких-либо сообщений о регистрации, либо отключены, то есть были неактивны дольше, чем задано в параметре mds.wd.offline_tout (по умолчанию 5 минут).

The cluster failed with N active, M inactive, K offline CS (mds.wd.max_offline_cs=<n>) (Произошел отказ кластера: N активных серверов фрагментов данных, M неактивных, K отключены)

MDS err (Ошибка MDS)

Создается, когда состояние кластера меняется на отказ кластера, а также при выборе нового главного сервера MDS.

Это сообщение указывает, что количество отключенных серверов фрагментов данных превышает число, заданное в параметре mds.wd.max_offline_cs (по умолчанию равно 2). В случае отказа кластера планирование автоматической репликации прекращается. Поэтому администратору кластера необходимо принять меры: либо восстановить отказавшие серверы кластера, либо увеличить значение mds.wd.max_offline_cs. При установке значения 0 этого параметра перехода в режим отказа не происходит никогда.

The cluster is filled up to <N>% (Кластер заполнен на <N> %)

MDS info/warn (Информация/предупреждение MDS)

Уведомляет о текущем использовании пространства в кластере. Если израсходовано 80 % и более дискового пространства, формируется предупреждение.

Важно иметь некоторый резервный объем дискового пространства для реплик данных на случай отказа одного из серверов фрагментов данных.

Replication started, N chunks are queued (Репликация начата, в очередь помещено N фрагментов)

MDS info (Информация MDS)

Создается, когда кластер начинает автоматическую репликацию данных для восстановления отсутствующих реплик.

Replication completed (Репликация завершена)

MDS info (Информация MDS)

Создается, когда кластер завершает автоматическую репликацию данных.

CS#<N> has reported hard error on path (CS № <N> сообщил об аппаратной ошибке по пути *path*)

MDS warn (Предупреждение MDS)

Создается, когда CS № <N> обнаруживает повреждение данных на диске.

Рекомендуется проверить оборудование на предмет ошибок и заменить диски с поврежденными данными как можно скорее.

CS#<N> has not registered during the last T sec and is marked as inactive/offline (CS № <N> не проходил регистрацию в течение последних T секунд и помечен как неактивный/отключенный)

MDS warn (Предупреждение MDS)

Создается, когда CS № <N> был недоступен в течение некоторого времени. Через 5 минут его состояние меняется на отключенный (offline), при этом запускается автоматическая репликация данных для восстановления реплик, хранившихся на сервере фрагментов данных, который оказался отключен.

Failed to allocate N replicas for ‘path’ by request from <addr>:<port> - K out of M chunks servers are available (Не удалось распределить N реплик для пути 'path' по запросу от <addr>:<port> — K из M серверов фрагментов данных недоступны)

MDS warn (Предупреждение MDS)

Создается, когда кластер не может выделить пространство для реплик фрагментов, например в случае, если на нем исчерпалось дисковое пространство.

Failed to allocate N replicas for ‘path’ by request from <addr>:<port> since only K chunk servers are registered (Не удалось распределить N реплик для пути 'path' по запросу от <addr>:<port>, поскольку зарегистрировано лишь K серверов фрагментов данных)

MDS warn (Предупреждение MDS)

Создается, когда кластер не может выделить пространство для реплик фрагментов, потому что в кластере зарегистрировано слишком мало серверов фрагментов данных.