Устранение неполадок дисков сервера#
Статус S.M.A.R.T. всех дисков отслеживается инструментом smartctl, который устанавливается вместе с продуктом Кибер Инфраструктура. Запускаемый каждые 10 минут инструмент опрашивает все диски, присоединенные к серверам, включая твердотельные накопители журналирования и системные диски, и передает результаты на сервер управления. Инструмент проверяет состояние диска с учетом атрибутов S.M.A.R.T. Если диск близок к отказу, отображается оповещение. Состояние на грани отказа означает, что как минимум один из следующих атрибутов S.M.A.R.T. отличается от нуля:
Reallocated Sector Count (Количество перераспределенных секторов)
Reallocated Event Count (Количество событий перераспределения)
Current Pending Sector Count (Текущее количество ожидающих секторов)
Uncorrectable Sector Count (Количество не подлежащих исправлению секторов)
Анализаторы медленных дисков и CS служат для расчета состояния диска с учетом средней задержки при выполнении операций ввода-вывода с течением времени. Когда показатель задержки достигает установленного порога, считается, что состояние диска равно 0 %. В этом случае создается предупреждение и диск помечается как медленный.
Ограничения
Чтобы инструмент работал, функциональность S.M.A.R.T. должна быть включена в параметрах BIOS сервера.
Предварительные требования
Четкое понимание процедуры расчета состояния диска, описанной в разделе Расчет состояния диска.
Как выполнить диагностику медленно работающего диска
Перейдите на экран Инфраструктура → Серверы и щелкните по имени сервера, на котором размещен медленный диск хранилища.
На вкладке Диски щелкните по этому диску хранилища и перейдите на вкладку Сервис, чтобы просмотреть предупреждающее сообщение.
Проверьте подключение диска, статус S.M.A.R.T. и выходные данные
dmesgдля этого сервера.
Исправив проблему, нажмите Пометить как исправный, чтобы изменить статус диска на Исправен. Если устранить проблему не удалось, рекомендуется заменить диск до его отказа. Если восстановить такой диск, он может снизить производительность кластера и увеличить задержку ввода-вывода.
Как выполнить диагностику отказавшего диска
Перейдите на экран Инфраструктура → Серверы и щелкните по имени сервера, на котором размещен отказавший сервис.
На вкладке Диски щелкните по отказавшему диску и перейдите на вкладку Сервис, чтобы просмотреть сообщение об ошибке.
Нажмите Получить диагностическую информацию, чтобы проверить выходные данные
smartctlиdmesg.Если для ошибки сервиса есть соответствующая статья базы знаний, нажмите Перейти в базу знаний, чтобы узнать подробные сведения о проблеме.
Если не удается исправить проблему, обратитесь в службу технической поддержки, как описано в разделе Получение технической поддержки.
Узнайте имя устройства отказавшего диска сервера из вывода команды
vinfra node disk list:# vinfra node disk list --node node003 +-------------+---------+------+--------+-------------+----------+----------+---------------+------------+----------------+ | id | device | type | role | disk_status | used | size | physical_size | service_id | service_status | +-------------+---------+------+--------+-------------+----------+----------+---------------+------------+----------------+ | 36972905<…> | nvme1n1 | ssd | cs | ok | 1.5TiB | 1.8TiB | 1.8TiB | 1090 | failed | | B9F2C34F<…> | nvme0n1 | ssd | cs | ok | 1.5TiB | 1.8TiB | 1.8TiB | 1091 | active | | A8E05CCA<…> | nvme2n1 | ssd | cs | ok | 1.5TiB | 1.8TiB | 1.8TiB | 1086 | active | | D6E421E0<…> | nvme3n1 | ssd | cs | ok | 1.5TiB | 1.8TiB | 1.8TiB | 1087 | active | | md126 | md126 | ssd | system | ok | 364.2MiB | 989.9MiB | 1022.0MiB | | | | md127 | md127 | ssd | system | ok | 104.4GiB | 187.1GiB | 190.2GiB | | | +-------------+---------+------+--------+-------------+----------+----------+---------------+------------+----------------+
Диск
nvme1n1сервераnode003отмечен как отказавший.Проверьте выходные данные
smartctlиdmesgдля отказавшего диска. Например:# vinfra node disk show diagnostic-info --node node003 nvme1n1 -f yaml - command: smartctl --all /dev/nvme1n1 stdout: 'smartctl 7.1 2020-06-20 r5066 [x86_64-linux-3.10.0-1160.41.1.vz7.183.5] (local build) Copyright (C) 2002-19, Bruce Allen, Christian Franke, www.smartmontools.org === START OF INFORMATION SECTION === Model Number: INTEL SSDPE2KX020T8 Serial Number: PHLJ9500032H2P0BGN Firmware Version: VDV10131 PCI Vendor/Subsystem ID: 0x8086 IEEE OUI Identifier: 0x5cd2e4 Total NVM Capacity: 2,000,398,934,016 [2.00 TB] Unallocated NVM Capacity: 0 Controller ID: 0 Number of Namespaces: 1 Namespace 1 Size/Capacity: 2,000,398,934,016 [2.00 TB] Namespace 1 Formatted LBA Size: 512 Namespace 1 IEEE EUI-64: 5cd2e4 75b0070100 Local Time is: Fri Nov 26 13:32:44 2021 EET Firmware Updates (0x02): 1 Slot Optional Admin Commands (0x000e): Format Frmw_DL NS_Mngmt Optional NVM Commands (0x0006): Wr_Unc DS_Mngmt Maximum Data Transfer Size: 32 Pages Warning Comp. Temp. Threshold: 70 Celsius Critical Comp. Temp. Threshold: 80 Celsius Supported Power States St Op Max Active Idle RL RT WL WT Ent_Lat Ex_Lat 0 + 25.00W - - 0 0 0 0 0 0 Supported LBA Sizes (NSID 0x1) Id Fmt Data Metadt Rel_Perf 0 + 512 0 2 1 - 4096 0 0 === START OF SMART DATA SECTION === SMART overall-health self-assessment test result: PASSED SMART/Health Information (NVMe Log 0x02) Critical Warning: 0x00 Temperature: 34 Celsius Available Spare: 99% Available Spare Threshold: 10% Percentage Used: 5% Data Units Read: 550,835,698 [282 TB] Data Units Written: 720,479,182 [368 TB] Host Read Commands: 10,050,305,459 Host Write Commands: 20,760,365,218 Controller Busy Time: 1,968 Power Cycles: 20 Power On Hours: 13,405 Unsafe Shutdowns: 16 Media and Data Integrity Errors: 0 Error Information Log Entries: 0 Warning Comp. Temperature Time: 0 Critical Comp. Temperature Time: 0 Error Information (NVMe Log 0x01, max 64 entries) No Errors Logged ' - command: dmesg --ctime --kernel --level=emerg,alert,crit,err,warn --facility=kern | grep 'nvme1n1' stdout: ''
Если не удается исправить проблему, обратитесь в службу технической поддержки, как описано в разделе Получение технической поддержки.
Что дальше