Hardware replacement SLA должен описывать процесс, а не только обещать срок. Важно знать, с какого события идёт отсчёт, какие доказательства нужны, что считается заменой и кто возвращает сервис в рабочее состояние.

RAID, второй порт и запасной сервер уменьшают отдельные риски, но не создают восстановление автоматически. Для каждого отказа нужен заранее проверенный путь.

01

Сначала определяется приоритет и начало отсчёта

Отсчёт может начинаться с автоматического мониторинга, регистрации тикета или подтверждения инженером. Эти моменты отличаются на десятки минут. Для критической услуги лучше заранее определить канал P1 и данные, которые клиент прикладывает сразу.

  • код сервера и время начала симптомов;
  • доступность IPMI/KVM и состояние питания;
  • ошибки ОС, SMART, RAID или сетевого интерфейса;
  • результаты проверки с внешней сети;
  • последние изменения перед отказом.
ДальшеПри отказе диска важны данные и rebuild
02

При отказе диска важны данные и rebuild

Инженер подтверждает неисправный накопитель и согласует замену. Нужно знать, будет ли установлен тот же класс и объём, можно ли вернуть старый диск клиенту или уничтожить его и кто запускает восстановление массива.

Замена диска не возвращает данные, если RAID отсутствует или повреждение затронуло несколько накопителей. Даже успешный rebuild не заменяет внешнюю резервную копию и проверку целостности приложения.

  • срок диагностики и физической замены;
  • минимально допустимая модель и ресурс нового диска;
  • кто запускает и контролирует rebuild;
  • что происходит со снятым носителем;
  • какой внешний backup используется при потере данных.
ДальшеПри отказе сервера нужен план замены узла
03

При отказе сервера нужен план замены узла

Если неисправна плата, питание или контроллер, ремонт на месте может быть дольше переноса на запасную машину. В SLA следует указать, предоставляется ли эквивалентный узел и как переносятся диски, адреса, VLAN и доступ IPMI.

Эквивалентность нужно определить заранее. Большее число ядер не всегда заменяет нужное поколение CPU, тип памяти, линии PCIe или конкретный контроллер.

ДальшеПри отказе порта проверяется весь тракт
04

При отказе порта проверяется весь тракт

Проблема может находиться в NIC, кабеле, оптике, порту коммутатора, VLAN или upstream-маршруте. Поэтому замена кабеля без проверки счётчиков и линка не завершает диагностику.

Второй порт помогает только при заранее настроенном резервировании. Bond или LACP требуют поддержки со стороны коммутатора; два независимых интерфейса без общей схемы не переключают трафик автоматически.

  • link state и аппаратные счётчики ошибок;
  • кабель или оптический модуль;
  • NIC и драйвер на сервере;
  • порт, VLAN и конфигурация коммутатора;
  • внешний маршрут и доступность upstream.
ДальшеIPMI и резервные копии закрывают разные риски
05

IPMI и резервные копии закрывают разные риски

IPMI/KVM позволяет увидеть загрузку, изменить настройки и переустановить систему, но не хранит данные приложения. Резервная копия помогает восстановить данные, но не заменяет доступ к консоли и запасное оборудование.

Для критической нагрузки нужны оба механизма и проверенная процедура: кто инициирует восстановление, где лежит копия, как выдаётся временный сервер и как возвращается исходная схема.

ДальшеЧто должно быть записано в SLA
06

Что должно быть записано в SLA

Число вроде «замена за два часа» бесполезно без точки отсчёта, режима NOC и исключений. Запишите время реакции, обновлений, диагностики и физической замены отдельно. Укажите плановую профилактику, удалённые руки, запчасти и порядок эскалации.

Компенсация не возвращает данные и не сокращает простой, но делает обязательство измеримым. Важно знать окно подачи требования, способ расчёта и максимальный размер кредита.

  • доступность и режим NOC;
  • реакция и обновления по P1/P2/P3;
  • срок диагностики и hardware replacement;
  • исключения, профилактика и ответственность за данные;
  • компенсация, срок обращения и процесс эскалации.
ДальшеПерейти к вопросам по теме