Мониторинг хранилища объектов

Мониторинг хранилища объектов#

Работу кластера S3 и его компонентов можно отслеживать на экране Сервисы хранилища → S3 → Обзор с помощью следующих диаграмм:

  • Доступность сервисов NS, OS и GW. Если сервис S3 GW имеет статус "ошибка", то, скорее всего, узел, на котором он размещен, не работает. Это некритично для кластера S3, поскольку высокая доступность сервиса S3 основана на записях DNS. Если записи DNS правильно настроены, сервис S3 остается полностью доступен через клиенты S3. С другой стороны, сбой сервиса OS или NS является критичным, поскольку в этом случае весь кластер S3 не сможет правильно работать. Если вы видите, что некоторые из сервисов NS или OS недоступны, но при этом все серверы кластера исправны и сеть с типом трафика OSTOR внутр. работает нормально, обратитесь в техническую поддержку. Также можно попытаться выяснить причины сбоя через панели мониторинга Grafana.

  • Частота операций. Диаграмма показывает общую загрузку кластера запросами пользователей S3, включая все типы операций.

  • Частота ошибок запросов. Запросы формируются пользователями или их приложениями. Некоторые запросы невозможно обработать. Например, они могут запрашивать несуществующие объекты, иметь неправильные права доступа или использовать неподдерживаемые функции (см. раздел Поддерживаемые функции Amazon S3). Поэтому нормально, если ошибки составляют небольшую часть общего объема операций. Но это также может указывать на неправильную работу приложения S3, которое используется для доступа. Кроме того, если кластер S3 открыт для публичного доступа, его могут сканировать роботы поисковых систем. В этом случае резкие скачки количества ошибок будут отражать их проблемы с несоответствием прав доступа. Однако это не является критической проблемой для кластера.

  • Пропускная способность. Диаграмма показывает общую загрузку кластера запросами пользователей S3.

  • Задержка при PUT-запросах и Задержка при GET-запросах. Эти значения измеряются с момента получения последнего байта пользовательского запроса до момента отправки первого байта ответа.

Расширенный мониторинг кластера S3 с помощью Grafana

Для расширенного мониторинга кластера S3 перейдите на страницу Сервисы хранилища → S3 → Обзор и нажмите Панель Grafana. Откроется отдельная вкладка браузера с предварительно настроенными панелями Grafana. Чтобы просмотреть подробное описание каждой диаграммы, щелкните по значку i в ее левом углу.

Для детального мониторинга сервисов OS и NS используйте панели Обзор объектного хранилища, Сведения о сервисе OS (object server) и Сведения о сервисе NS (name server). Отфильтруйте данные по серверам и томам, чтобы выявить аномальное использование сервиса. Обратите внимание на диаграмму Задержки заданий: она показывает долю времени, потраченного на ожидание ЦП, доступной памяти (отъема), переноса памяти из файла подкачки и завершения операций ввода-вывода.

Панель мониторинга Обзор S3 показывает главным образом информацию о сервисе S3 GW. Здесь можно отслеживать работу объектного хранилища и интерфейса S3 с помощью следующих диаграмм:

  • Доступность шлюзов S3, Доступность сервисов NS и Доступность сервисов OS. Диаграммы показывают информацию о соответствующих сервисах S3. Период времени, в течение которого они не были доступны, выделен красным.

  • Задержка GET и Задержка PUT. Диаграмма показывает среднюю задержку и 95-й, 99-й и максимальный перцентиль задержки запросов S3 GET и PUT. Это значение измеряется с момента получения последнего байта запроса до момента отправки первого байта ответа.

  • Пропускная способность. Диаграмма показывает общий объем операций чтения или записи, проходящих через все шлюзы S3, в секунду.

  • Частота операций. Диаграмма показывает общее количество операций S3 GET, PUT, LIST и DELETE в секунду по всем шлюзам S3.

image2

Панель мониторинга Обзор георепликации S3 предназначена для отслеживания репликации данных по нескольким географически распределенным ЦОД.

  • Здесь самыми важными диаграммами являются Остаток репликации и Глубина очереди репликации. Если значения постоянно растут, то эффективность репликации падает. Это значит, что кластер получает больше данных, чем отправляет.

  • Частота ошибок локального S3 и Частота ошибок удаленного S3 помогают обнаружить проблемы подключения. Небольшое количество ошибок возможно, если кластеры реплицируются через Интернет с нестабильной задержкой.

image3