0Pricing
Cloud & IT Cert Prep · Урок

Отказоустойчивость и резервирование

Узнайте, как резервные маршруты и устройства предотвращают единственные точки отказа.

«Отказоустойчивость и резервирование» — бесплатный урок Cloud & IT Cert Prep на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Cloud & IT Cert Prep, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Cloud & IT Cert Prep содержит 4 уроков всего.

Цель высокой доступности

Высокая доступность (HA) означает проектирование сети таким образом, чтобы сервисы продолжали работать даже при отказе какого-либо компонента. Основная идея — устранить единственные точки отказа: компоненты, отказ которых выводит из строя всю систему. HA объединяет резервирование (наличие запасных компонентов) с переключением при отказе (автоматическим переходом на запасной компонент), поддерживая работу критически важных сервисов во время сбоев.

Единственные точки отказа

Единственная точка отказа (SPOF) — это любой элемент без резервного компонента: один маршрутизатор, один блок питания или одно интернет-соединение, потеря которого останавливает всё. Выявление SPOF — первый шаг при проектировании HA. Для каждого критически важного компонента следует спросить: «Что произойдёт, если он выйдет из строя?» Если ответ — «полный отказ», необходимо добавить резервирование.

Что означает резервирование

Резервирование — это наличие дублирующих компонентов, готовых принять работу на себя. Оно может применяться на любом уровне: резервные блоки питания, сетевые соединения, коммутаторы и маршрутизаторы, а также интернет-подключения. Резервирование стоит денег и усложняет систему, поэтому его применяют для компонентов, отказ которых нанесёт наибольший ущерб. Цель — не допустить отказа всей системы из-за одной неисправности.

Что означает переключение при отказе

Переключение при отказе — это автоматический переход с вышедшего из строя компонента на резервный. Одного резервирования недостаточно: резервный компонент должен быстро принять работу, желательно без вмешательства человека. Хорошее переключение выполняется быстро и незаметно, поэтому пользователи почти не замечают сбоя. Именно сочетание резервного компонента с автоматическим переключением обеспечивает настоящую высокую доступность.

Активный-активный и активный-пассивный режимы

Существуют две модели резервирования. В режиме активный-пассивный резервный компонент бездействует до отказа основного, после чего принимает его работу. В режиме активный-активный оба устройства работают одновременно и распределяют нагрузку; при отказе одного другое принимает на себя его долю. Режим активный-активный также увеличивает пропускную способность, а активный-пассивный проще. Каждый вариант подходит для разных задач и бюджетов.

Резервирование шлюза первого перехода

Шлюз по умолчанию часто является SPOF, поэтому протоколы резервирования шлюза первого перехода (FHRP) предоставляют резервный шлюз. VRRP (протокол резервирования виртуального маршрутизатора) и HSRP (протокол горячего резервирования маршрутизатора) Cisco позволяют двум маршрутизаторам совместно использовать один виртуальный IP-адрес шлюза; если активный маршрутизатор выходит из строя, резервный принимает этот адрес. Узлы продолжают использовать тот же шлюз и не замечают переключения.

Резервирование соединений и NIC

Резервирование применяется и к соединениям. Агрегирование каналов (LAG с использованием LACP) объединяет несколько физических соединений в одно логическое, обеспечивая дополнительную пропускную способность и продолжение работы при отказе одного из соединений. На серверах объединение NIC связывает несколько сетевых карт, поэтому передача данных продолжается при отказе одной карты или её кабеля. Оба подхода устраняют зависимость от одного соединения как единственной точки отказа.

Резервирование питания и оборудования

Многие проблемы имеют физическую природу. Резервные блоки питания позволяют устройству пережить отказ одного из блоков. UPS (источник бесперебойного питания) поддерживает оборудование во время кратковременных отключений, а генератор — во время более длительных. Компоненты с горячей заменой можно заменить без выключения питания. Всё это защищает от очень распространённых причин простоя: проблем с питанием и отказов оборудования.

Измерение доступности

HA измеряется количеством девяток доступности. Показатель 99,9% допускает около 8,8 часа простоя в год; 99,99% — около 53 минут; 99,999% («пять девяток») — около 5 минут. Важны и два других показателя: RTO (целевое время восстановления) — насколько быстро необходимо восстановить работу, и RPO (целевой показатель точки восстановления) — какой объём потери данных допустим. Эти целевые показатели определяют решения при проектировании.

У резервирования есть ограничения

Резервирование не бывает бесплатным и не может быть бесконечным. При неправильной настройке оно увеличивает стоимость и сложность системы, а также создаёт новые сценарии отказа. Чем больше копий компонентов, тем больше приходится обслуживать и тем выше вероятность ошибки конфигурации. Важно сопоставлять стоимость резервирования со стоимостью простоя каждого сервиса, защищая критически важные элементы без избыточного усложнения остальных.

Проектирование высокой доступности

Проектирование HA выполняется системно: составьте карту критически важных сервисов, найдите все SPOF, добавьте целевое резервирование с автоматическим переключением и проверьте, что переключение действительно работает. Непроверенный резервный компонент — это надежда, а не план. Регулярное моделирование отказов подтверждает работоспособность проекта и выявляет пробелы. При правильной реализации резервирование и переключение при отказе поддерживают работу сети, даже когда отдельные компоненты неизбежно выходят из строя.

Быстрая проверка

Проверьте свои знания о HA.

Итоги

Вы узнали о резервировании и переключении при отказе. Главное:

  • HA устраняет единственные точки отказа.
  • Резервирование добавляет запасные компоненты, а переключение при отказе автоматически переходит на них.
  • Режим активный-активный распределяет нагрузку, а активный-пассивный сохраняет резервный компонент в режиме ожидания.
  • VRRP/HSRP предоставляют резервный шлюз, а LAG и объединение NIC обеспечивают резервирование соединений.
  • Доступность измеряется количеством девяток, показателями RTO и RPO; переключение при отказе необходимо проверять.

Часто задаваемые вопросы

Урок «Отказоустойчивость и резервирование» бесплатный?

Да — полный текст урока «Отказоустойчивость и резервирование» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Cloud & IT Cert Prep, подпишись на CoddyKit PRO. Курс Cloud & IT Cert Prep содержит 4 уроков всего.

Чему я научусь в уроке «Отказоустойчивость и резервирование»?

Узнайте, как резервные маршруты и устройства предотвращают единственные точки отказа. Ты практикуешь Cloud & IT Cert Prep с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Cloud & IT Cert Prep?

Предыдущий опыт не требуется. Cloud & IT Cert Prep на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Отказоустойчивость и резервирование»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Cloud & IT Cert Prep?

Да. Каждый урок Cloud & IT Cert Prep включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Отказоустойчивость и резервирование
  2. Балансировка нагрузки между серверами
  3. Качество обслуживания для важного трафика
  4. Объединение знаний перед экзаменом
← Назад к Cloud & IT Cert Prep