Hardware replacement SLA должен описывать процесс, а не только обещать срок. Важно знать, с какого события идёт отсчёт, какие доказательства нужны, что считается заменой и кто возвращает сервис в рабочее состояние.
RAID, второй порт и запасной сервер уменьшают отдельные риски, но не создают восстановление автоматически. Для каждого отказа нужен заранее проверенный путь.
Сначала определяется приоритет и начало отсчёта
Отсчёт может начинаться с автоматического мониторинга, регистрации тикета или подтверждения инженером. Эти моменты отличаются на десятки минут. Для критической услуги лучше заранее определить канал P1 и данные, которые клиент прикладывает сразу.
- код сервера и время начала симптомов;
- доступность IPMI/KVM и состояние питания;
- ошибки ОС, SMART, RAID или сетевого интерфейса;
- результаты проверки с внешней сети;
- последние изменения перед отказом.
При отказе диска важны данные и rebuild
Инженер подтверждает неисправный накопитель и согласует замену. Нужно знать, будет ли установлен тот же класс и объём, можно ли вернуть старый диск клиенту или уничтожить его и кто запускает восстановление массива.
Замена диска не возвращает данные, если RAID отсутствует или повреждение затронуло несколько накопителей. Даже успешный rebuild не заменяет внешнюю резервную копию и проверку целостности приложения.
- срок диагностики и физической замены;
- минимально допустимая модель и ресурс нового диска;
- кто запускает и контролирует rebuild;
- что происходит со снятым носителем;
- какой внешний backup используется при потере данных.
При отказе сервера нужен план замены узла
Если неисправна плата, питание или контроллер, ремонт на месте может быть дольше переноса на запасную машину. В SLA следует указать, предоставляется ли эквивалентный узел и как переносятся диски, адреса, VLAN и доступ IPMI.
Эквивалентность нужно определить заранее. Большее число ядер не всегда заменяет нужное поколение CPU, тип памяти, линии PCIe или конкретный контроллер.
ДальшеПри отказе порта проверяется весь тракт→При отказе порта проверяется весь тракт
Проблема может находиться в NIC, кабеле, оптике, порту коммутатора, VLAN или upstream-маршруте. Поэтому замена кабеля без проверки счётчиков и линка не завершает диагностику.
Второй порт помогает только при заранее настроенном резервировании. Bond или LACP требуют поддержки со стороны коммутатора; два независимых интерфейса без общей схемы не переключают трафик автоматически.
- link state и аппаратные счётчики ошибок;
- кабель или оптический модуль;
- NIC и драйвер на сервере;
- порт, VLAN и конфигурация коммутатора;
- внешний маршрут и доступность upstream.
IPMI и резервные копии закрывают разные риски
IPMI/KVM позволяет увидеть загрузку, изменить настройки и переустановить систему, но не хранит данные приложения. Резервная копия помогает восстановить данные, но не заменяет доступ к консоли и запасное оборудование.
Для критической нагрузки нужны оба механизма и проверенная процедура: кто инициирует восстановление, где лежит копия, как выдаётся временный сервер и как возвращается исходная схема.
ДальшеЧто должно быть записано в SLA→Что должно быть записано в SLA
Число вроде «замена за два часа» бесполезно без точки отсчёта, режима NOC и исключений. Запишите время реакции, обновлений, диагностики и физической замены отдельно. Укажите плановую профилактику, удалённые руки, запчасти и порядок эскалации.
Компенсация не возвращает данные и не сокращает простой, но делает обязательство измеримым. Важно знать окно подачи требования, способ расчёта и максимальный размер кредита.
- доступность и режим NOC;
- реакция и обновления по P1/P2/P3;
- срок диагностики и hardware replacement;
- исключения, профилактика и ответственность за данные;
- компенсация, срок обращения и процесс эскалации.