Устранение неполадок дисков сервера

Устранение неполадок дисков сервера#

Статус S.M.A.R.T. всех дисков отслеживается инструментом smartctl, который устанавливается вместе с продуктом Кибер Инфраструктура. Запускаемый каждые 10 минут инструмент опрашивает все диски, присоединенные к серверам, включая твердотельные накопители журналирования и системные диски, и передает результаты на сервер управления. Инструмент проверяет состояние диска с учетом атрибутов S.M.A.R.T. Если диск близок к отказу, отображается оповещение. Состояние на грани отказа означает, что как минимум один из следующих атрибутов S.M.A.R.T. отличается от нуля:

  • Reallocated Sector Count (Количество перераспределенных секторов)

  • Reallocated Event Count (Количество событий перераспределения)

  • Current Pending Sector Count (Текущее количество ожидающих секторов)

  • Uncorrectable Sector Count (Количество не подлежащих исправлению секторов)

Анализаторы медленных дисков и CS служат для расчета состояния диска с учетом средней задержки при выполнении операций ввода-вывода с течением времени. Когда показатель задержки достигает установленного порога, считается, что состояние диска равно 0 %. В этом случае создается предупреждение и диск помечается как медленный.

Ограничения

  • Чтобы инструмент работал, функциональность S.M.A.R.T. должна быть включена в параметрах BIOS сервера.

Предварительные требования

Как выполнить диагностику медленно работающего диска

  1. Перейдите на экран Инфраструктура → Серверы и щелкните по имени сервера, на котором размещен медленный диск хранилища.

  2. На вкладке Диски щелкните по этому диску хранилища и перейдите на вкладку Сервис, чтобы просмотреть предупреждающее сообщение.

  3. Проверьте подключение диска, статус S.M.A.R.T. и выходные данные dmesg для этого сервера.

Исправив проблему, нажмите Пометить как исправный, чтобы изменить статус диска на Исправен. Если устранить проблему не удалось, рекомендуется заменить диск до его отказа. Если восстановить такой диск, он может снизить производительность кластера и увеличить задержку ввода-вывода.

Как выполнить диагностику отказавшего диска

  1. Перейдите на экран Инфраструктура → Серверы и щелкните по имени сервера, на котором размещен отказавший сервис.

  2. На вкладке Диски щелкните по отказавшему диску и перейдите на вкладку Сервис, чтобы просмотреть сообщение об ошибке.

  3. Нажмите Получить диагностическую информацию, чтобы проверить выходные данные smartctl и dmesg.

  4. Если для ошибки сервиса есть соответствующая статья базы знаний, нажмите Перейти в базу знаний, чтобы узнать подробные сведения о проблеме.

Если не удается исправить проблему, обратитесь в службу технической поддержки, как описано в разделе Получение технической поддержки.

  1. Узнайте имя устройства отказавшего диска сервера из вывода команды vinfra node disk list:

    # vinfra node disk list --node node003
    +-------------+---------+------+--------+-------------+----------+----------+---------------+------------+----------------+
    | id          | device  | type | role   | disk_status | used     | size     | physical_size | service_id | service_status |
    +-------------+---------+------+--------+-------------+----------+----------+---------------+------------+----------------+
    | 36972905<…> | nvme1n1 | ssd  | cs     | ok          | 1.5TiB   | 1.8TiB   | 1.8TiB        | 1090       | failed         |
    | B9F2C34F<…> | nvme0n1 | ssd  | cs     | ok          | 1.5TiB   | 1.8TiB   | 1.8TiB        | 1091       | active         |
    | A8E05CCA<…> | nvme2n1 | ssd  | cs     | ok          | 1.5TiB   | 1.8TiB   | 1.8TiB        | 1086       | active         |
    | D6E421E0<…> | nvme3n1 | ssd  | cs     | ok          | 1.5TiB   | 1.8TiB   | 1.8TiB        | 1087       | active         |
    | md126       | md126   | ssd  | system | ok          | 364.2MiB | 989.9MiB | 1022.0MiB     |            |                |
    | md127       | md127   | ssd  | system | ok          | 104.4GiB | 187.1GiB | 190.2GiB      |            |                |
    +-------------+---------+------+--------+-------------+----------+----------+---------------+------------+----------------+
    

    Диск nvme1n1 сервера node003 отмечен как отказавший.

  2. Проверьте выходные данные smartctl и dmesg для отказавшего диска. Например:

    # vinfra node disk show diagnostic-info --node node003 nvme1n1 -f yaml
    - command: smartctl --all /dev/nvme1n1
      stdout: 'smartctl 7.1 2020-06-20 r5066 [x86_64-linux-3.10.0-1160.41.1.vz7.183.5]
        (local build)
      Copyright (C) 2002-19, Bruce Allen, Christian Franke, www.smartmontools.org
    
      === START OF INFORMATION SECTION ===
      Model Number:                       INTEL SSDPE2KX020T8
      Serial Number:                      PHLJ9500032H2P0BGN
      Firmware Version:                   VDV10131
      PCI Vendor/Subsystem ID:            0x8086
      IEEE OUI Identifier:                0x5cd2e4
      Total NVM Capacity:                 2,000,398,934,016 [2.00 TB]
      Unallocated NVM Capacity:           0
      Controller ID:                      0
      Number of Namespaces:               1
      Namespace 1 Size/Capacity:          2,000,398,934,016 [2.00 TB]
      Namespace 1 Formatted LBA Size:     512
      Namespace 1 IEEE EUI-64:            5cd2e4 75b0070100
      Local Time is:                      Fri Nov 26 13:32:44 2021 EET
      Firmware Updates (0x02):            1 Slot
      Optional Admin Commands (0x000e):   Format Frmw_DL NS_Mngmt
      Optional NVM Commands (0x0006):     Wr_Unc DS_Mngmt
      Maximum Data Transfer Size:         32 Pages
      Warning  Comp. Temp. Threshold:     70 Celsius
      Critical Comp. Temp. Threshold:     80 Celsius
    
      Supported Power States
      St Op     Max   Active     Idle   RL RT WL WT  Ent_Lat  Ex_Lat
       0 +    25.00W       -        -    0  0  0  0        0       0
    
      Supported LBA Sizes (NSID 0x1)
      Id Fmt  Data  Metadt  Rel_Perf
       0 +     512       0         2
       1 -    4096       0         0
    
      === START OF SMART DATA SECTION ===
      SMART overall-health self-assessment test result: PASSED
    
      SMART/Health Information (NVMe Log 0x02)
      Critical Warning:                   0x00
      Temperature:                        34 Celsius
      Available Spare:                    99%
      Available Spare Threshold:          10%
      Percentage Used:                    5%
      Data Units Read:                    550,835,698 [282 TB]
      Data Units Written:                 720,479,182 [368 TB]
      Host Read Commands:                 10,050,305,459
      Host Write Commands:                20,760,365,218
      Controller Busy Time:               1,968
      Power Cycles:                       20
      Power On Hours:                     13,405
      Unsafe Shutdowns:                   16
      Media and Data Integrity Errors:    0
      Error Information Log Entries:      0
      Warning  Comp. Temperature Time:    0
      Critical Comp. Temperature Time:    0
    
      Error Information (NVMe Log 0x01, max 64 entries)
      No Errors Logged
      '
    - command: dmesg --ctime --kernel --level=emerg,alert,crit,err,warn --facility=kern
        | grep 'nvme1n1'
      stdout: ''
    

Если не удается исправить проблему, обратитесь в службу технической поддержки, как описано в разделе Получение технической поддержки.