Режим минимального ядра и тёплый резерв
Поддерживайте минимальное ядро нагрузки во втором регионе (режим минимального ядра) или уменьшенную, но полностью работоспособную копию (тёплый резерв), готовую к масштабированию.
«Режим минимального ядра и тёплый резерв» — бесплатный урок Cloud & IT Cert Prep на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Cloud & IT Cert Prep, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Cloud & IT Cert Prep содержит 4 уроков всего.
За пределами Backup and Restore
Если требование к RTO строже, чем несколько часов, стратегия Backup and Restore недостаточна. Следующие два уровня DR — Pilot Light и Warm Standby — постоянно поддерживают часть или всю инфраструктуру в рабочем состоянии в регионе DR, значительно сокращая время восстановления. Обе стратегии предполагают постоянное обслуживание среды DR и использование переключения на основе проверки состояния Route 53 для перенаправления трафика во время аварии. Разница заключается в том, какая часть среды DR активно работает.
Pilot Light: постоянно работающая основа
В стратегии Pilot Light в регионе DR работает только критически важная основа системы — обычно лишь уровень базы данных с непрерывной репликацией. Серверы приложений НЕ запущены; вместо этого Вы поддерживаете заранее созданные AMI, шаблоны запуска или инфраструктуру как код, с помощью которых их можно быстро запустить. Представьте небольшой запальник, который при необходимости за несколько минут разжигает полное пламя. Обычно RTO составляет 30–60 минут.
# Pilot Light: what runs 24/7 in DR region
# - RDS Read Replica (receiving continuous replication)
# - Minimal VPC/networking (no extra cost if no data transfer)
# - Route 53 failover record (inactive, health check pointing to primary)
# What is prepared but NOT running:
# - EC2 launch template pointing to DR AMI
# - ALB (can be created in minutes)
# - ASG with desired=0, can scale to 10 on demandЭтапы переключения Pilot Light
Когда основной регион выходит из строя и запускается переключение Pilot Light: этап 1 — повысить реплику чтения RDS в регионе DR до отдельной основной базы данных. Этап 2 — запустить экземпляры EC2 из заранее созданного AMI или шаблона запуска. Этап 3 — создать или активировать Application Load Balancer и зарегистрировать новые экземпляры EC2. Этап 4 — обновить конфигурацию приложения, указав конечную точку повышенной базы данных. Этап 5 — проверка состояния Route 53 завершает переключение DNS. Общее время: 30–60 минут.
# Step 1: Promote RDS Read Replica
aws rds promote-read-replica \
--db-instance-identifier mydb-dr-replica \
--region us-west-2
# Step 2: Scale up ASG in DR region
aws autoscaling update-auto-scaling-group \
--auto-scaling-group-name app-asg-dr \
--min-size 2 \
--desired-capacity 4 \
--region us-west-2
# Step 3: Route 53 failover happens automatically
# via health check detecting primary region failureWarm Standby: полностью функциональная, но уменьшенная среда
В стратегии Warm Standby в регионе DR постоянно работает полная, но уменьшенная копия рабочей среды. Активны все уровни приложения — веб-серверы, серверы приложений и база данных, — но с уменьшенной ёмкостью (например, 2 экземпляра вместо 20). Во время переключения Вы увеличиваете масштаб среды DR в соответствии с рабочей нагрузкой. Route 53 автоматически переключает трафик с помощью переключения на основе проверки состояния. Обычно RTO составляет менее 15 минут. Warm Standby — самый популярный уровень DR для критически важных бизнес-приложений.
# Production vs Warm Standby capacity:
# Tier Production DR Standby
# Web servers 20 EC2 (c5.xl) 2 EC2 (c5.xl)
# App servers 10 EC2 (m5.xl) 2 EC2 (m5.xl)
# Database RDS db.r5.2xl RDS Read Replica (db.r5.xl)
# Cache Redis r6g.xl Redis r6g.medium
#
# Cost: DR standby ~15% of production costAurora Global Database для Warm Standby
Aurora Global Database — идеальная технология баз данных для DR по стратегии Warm Standby. Кластер во вторичном регионе постоянно работает, постоянно получает репликацию (задержка <1 секунды) и может быть повышен до основной базы менее чем за 1 минуту — значительно быстрее, чем реплика чтения RDS, для повышения которой требуется остановить репликацию и применить оставшуюся задержку. Поэтому Aurora Global Database рекомендуется использовать, когда требование к RTO измеряется минутами, а не десятками минут.
# Promote Aurora Global DB secondary to primary
# (during DR failover)
aws rds failover-global-cluster \
--global-cluster-identifier my-global-db \
--target-db-cluster-identifier my-aurora-cluster-us-west-2
# Aurora handles promotion automatically
# Typical promotion time: 1-2 minutes
# vs RDS Read Replica promotion: 10-30 minutesНастройка автоматического переключения Route 53
И Pilot Light, и Warm Standby используют маршрутизацию с переключением Route 53 для автоматического перенаправления трафика. Настройте запись Primary, указывающую на ALB или конечную точку рабочего региона, и подключите к ней проверку состояния. Настройте запись Secondary, указывающую на конечную точку региона DR. Когда Route 53 обнаруживает, что проверка состояния основной записи не прошла заданное число раз, он перестаёт возвращать основную запись и обслуживает только вторичную — всё это происходит в пределах периода TTL DNS.
# Primary record (production)
aws route53 change-resource-record-sets \
--hosted-zone-id ZXXX \
--change-batch '{
"Changes": [{
"Action": "UPSERT",
"ResourceRecordSet": {
"Name": "api.example.com",
"Type": "A",
"Failover": "PRIMARY",
"SetIdentifier": "primary",
"HealthCheckId": "hc-us-east-1",
"AliasTarget": {"DNSName": "alb-prod.us-east-1.elb.amazonaws.com","EvaluateTargetHealth": true}
}
}]
}'Предварительная подготовка среды DR
Чтобы Warm Standby достиг целевого RTO, среда DR должна быть предварительно подготовлена: полностью настроена и протестирована так, чтобы при переключении требовалось только увеличить масштаб. Это означает, что подключения к базе данных установлены и кэшированы, файлы конфигурации приложения ссылаются на конечные точки региона DR, экземпляры EC2 обслуживаются за ALB (даже в небольшом количестве), а проверки состояния проходят успешно. Проводите ежемесячные тренировки DR, имитируя переключение, чтобы среда оставалась синхронизированной с конфигурацией рабочей среды.
# Validate DR warm standby health
# 1. Check DR ALB target health
aws elbv2 describe-target-health \
--target-group-arn arn:aws:elasticloadbalancing:us-west-2:123:targetgroup/app-dr/xyz
# 2. Check Aurora Global DB secondary
aws rds describe-global-clusters \
--global-cluster-identifier my-global-db
# 3. Verify Route 53 health checks
aws route53 get-health-check-status \
--health-check-id hc-us-west-2Инфраструктура как код для согласованности DR
Поддержание синхронизации среды DR с рабочей средой — самая сложная операционная задача. Если Вы настроите рабочую среду вручную и забудете обновить DR, среда DR может неправильно работать во время настоящей аварии. Решение — инфраструктура как код (IaC) с одинаковыми шаблонами, развёрнутыми в обоих регионах. Используйте AWS CloudFormation StackSets или Terraform с несколькими рабочими пространствами, чтобы развёртывать идентичную инфраструктуру в обоих регионах из единой кодовой базы. Это устраняет расхождения конфигурации.
# CloudFormation StackSet: deploy to multiple regions
aws cloudformation create-stack-set \
--stack-set-name my-app-infrastructure \
--template-url https://s3.amazonaws.com/mybucket/template.yaml
# Deploy to DR region
aws cloudformation create-stack-instances \
--stack-set-name my-app-infrastructure \
--accounts 123456789012 \
--regions us-west-2 \
--parameter-overrides \
ParameterKey=DesiredCapacity,ParameterValue=2Сравнение стоимости: Pilot Light и Warm Standby
Разница в стоимости двух стратегий значительна. Pilot Light требует оплаты только реплики базы данных (обычно 50–100% стоимости основной базы данных) и минимальных сетевых ресурсов в регионе DR. Серверы приложений выключены, поэтому расходы на EC2 отсутствуют. Warm Standby добавляет стоимость работающих экземпляров EC2 уменьшенного размера, ALB и, возможно, небольшого кластера кэширования — обычно это 15–30% стоимости всей рабочей среды. Вопрос заключается в том, оправдывает ли более быстрый RTO Warm Standby более высокие постоянные расходы.
# Example monthly cost comparison:
# Production environment: $10,000/month
# Pilot Light DR:
# RDS Read Replica: $500/month
# Minimal networking: $50/month
# Total: $550/month (~5.5% of production)
# Warm Standby DR:
# RDS Read Replica: $500/month
# 2x EC2 instances: $400/month
# ALB + networking: $200/month
# Total: $1,100/month (~11% of production)Возврат: возвращение в Primary
После восстановления основного региона Вам потребуется план возврата к нему. Возврат часто является самой сложной частью DR: во время сбоя в регионе DR могли быть обработаны новые данные, которые необходимо синхронизировать с основным регионом. Для баз данных может потребоваться настроить обратную репликацию или повторную синхронизацию из DR в основной регион. Для Route 53 необходимо восстановить основную запись вместе с её проверкой работоспособности. Всегда планируйте и тестируйте процедуру возврата так же тщательно, как и сам переход в резервный режим.
# Failback procedure steps:
# 1. Restore primary region infrastructure
# 2. Set up replication from DR to primary
# (reverse replication to sync new data)
# 3. Verify data consistency
# 4. Re-enable primary Route 53 health check
# 5. Gradually shift traffic back (weighted routing)
# Route 53 weights: Primary=10%, DR=90%
# Primary=50%, DR=50%
# Primary=100%, DR=0%
# 6. Decommission DR region back to standby capacityКогда выбирать Pilot Light, а когда Warm Standby
Выбирайте Pilot Light, когда Ваш RTO допускает 30–60 минут и Вы хотите минимизировать затраты на DR. Основной риск — время, необходимое для запуска и настройки серверов приложений во время аварии в условиях стресса. Выбирайте Warm Standby, когда восстановление согласно RTO должно занимать не более 15 минут, приложение достаточно сложное и его запуск с нуля во время аварии сопряжён с риском либо обязательства по SLA перед клиентами требуют более быстрого восстановления. Для большинства производственных нагрузок средней критичности Warm Standby обеспечивает оптимальный баланс.
# Decision guide:
# RTO > 1 hour: Backup and Restore
# RTO 30-60 min: Pilot Light
# RTO 5-15 min: Warm Standby
# RTO < 5 min: Multi-Site Active-Active
# Additional factors for Warm Standby:
# - Complex application startup procedures
# - Contractual SLA commitments to customers
# - High revenue loss per minute of downtime
# - Regulatory requirements for fast recoveryБыстрая проверка
Проверьте, насколько хорошо Вы усвоили концепции AWS Solutions Architect (SAA-C03) из этого урока.
Итоги урока
В этом уроке Вы узнали, что Pilot Light поддерживает в DR только работающую базу данных и запускает серверы приложений во время перехода в резервный режим, Warm Standby поддерживает полностью готовую уменьшенную среду, которая масштабируется во время перехода в резервный режим, а Infrastructure as Code предотвращает расхождение конфигураций между основным и DR-окружениями. Всегда планируйте и тестируйте процедуры возврата так же, как и процедуры перехода в резервный режим. Далее мы рассмотрим активную работу на нескольких площадках с DynamoDB Global Tables и Route 53.
Часто задаваемые вопросы
Урок «Режим минимального ядра и тёплый резерв» бесплатный?
Да — полный текст урока «Режим минимального ядра и тёплый резерв» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Cloud & IT Cert Prep, подпишись на CoddyKit PRO. Курс Cloud & IT Cert Prep содержит 4 уроков всего.
Чему я научусь в уроке «Режим минимального ядра и тёплый резерв»?
Поддерживайте минимальное ядро нагрузки во втором регионе (режим минимального ядра) или уменьшенную, но полностью работоспособную копию (тёплый резерв), готовую к масштабированию. Ты практикуешь Cloud & IT Cert Prep с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Cloud & IT Cert Prep?
Предыдущий опыт не требуется. Cloud & IT Cert Prep на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Режим минимального ядра и тёплый резерв»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Cloud & IT Cert Prep?
Да. Каждый урок Cloud & IT Cert Prep включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- RTO, RPO и уровни DR
- Резервное копирование и восстановление
- Режим минимального ядра и тёплый резерв
- Активный режим в нескольких площадках с Global Tables и Route 53