AWS Solutions Architect · Lektion

Pilot Light och varm reservmiljö

Håll en minimal kärna av arbetsbelastningen igång i en andra region (pilot light) eller en nedskalad men fullt fungerande kopia (varm reservmiljö) som är redo att skalas upp.

Lektion 3 av 413 steg

Pilot Light och varm reservmiljö är en gratis lektion i AWS Solutions Architect på CoddyKit. Detta är lektion 3 av 4. Du kan läsa vilka 3 lektioner som helst i den här lärvägen kostnadsfritt i sin helhet – därefter låser CoddyKit PRO upp alla lektioner, plus praktisk övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Den ingår i lärvägen för AWS Solutions Architect, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i AWS Solutions Architect innehåller totalt 4 lektioner.

Bortom Backup and Restore

När ditt RTO-krav är strängare än några timmar räcker Backup and Restore inte till. De följande två DR-nivåerna — Pilot Light och Warm Standby — håller delar av eller hela infrastrukturen igång i DR-regionen hela tiden, vilket minskar återställningstiden avsevärt. Båda strategierna innebär att en DR-miljö underhålls kontinuerligt och att Route 53:s failover med hälsokontroller används för att omdirigera trafik under en katastrof. Skillnaden är hur stor del av DR-miljön som körs aktivt.

Pilot Light: kärnan körs alltid

Med strategin Pilot Light håller du endast den kritiska kärnan i systemet igång i DR-regionen — vanligtvis bara databasskiktet med kontinuerlig replikering. Applikationsservrarna körs INTE; i stället underhåller du förbyggda AMI:er, startmallar eller infrastruktur som kod, så att servrarna snabbt kan startas. Tänk på det som en sparlåga som brinner mycket svagt men kan tända hela lågan inom några minuter när det behövs. RTO:n är vanligtvis 30–60 minuter.

# Pilot Light: what runs 24/7 in DR region
# - RDS Read Replica (receiving continuous replication)
# - Minimal VPC/networking (no extra cost if no data transfer)
# - Route 53 failover record (inactive, health check pointing to primary)

# What is prepared but NOT running:
# - EC2 launch template pointing to DR AMI
# - ALB (can be created in minutes)
# - ASG with desired=0, can scale to 10 on demand

Steg för failover med Pilot Light

När den primära regionen slutar fungera och failover med Pilot Light utlöses: Steg 1 — Befordra RDS Read Replica i DR-regionen till en fristående primär databas. Steg 2 — Starta EC2-instanser från den förbyggda AMI:n eller startmallen. Steg 3 — Skapa eller aktivera Application Load Balancer och registrera de nya EC2-instanserna. Steg 4 — Uppdatera applikationskonfigurationen så att den pekar på den befordrade databasens slutpunkt. Steg 5 — Route 53:s failover med hälsokontroll slutför DNS-omkopplingen. Total tid: 30–60 minuter.

# Step 1: Promote RDS Read Replica
aws rds promote-read-replica \
  --db-instance-identifier mydb-dr-replica \
  --region us-west-2

# Step 2: Scale up ASG in DR region
aws autoscaling update-auto-scaling-group \
  --auto-scaling-group-name app-asg-dr \
  --min-size 2 \
  --desired-capacity 4 \
  --region us-west-2

# Step 3: Route 53 failover happens automatically
# via health check detecting primary region failure

Warm Standby: fullt fungerande men nedskalad

Med strategin Warm Standby körs en komplett men nedskalad version av produktionsmiljön kontinuerligt i DR-regionen. Alla applikationsskikt är aktiva — webbservrar, applikationsservrar och databas — men med minskad kapacitet (till exempel 2 instanser i stället för 20). Under failover skalar du upp DR-miljön så att den motsvarar produktionsbelastningen. Route 53 växlar automatiskt över trafiken genom failover med hälsokontroll. RTO:n är vanligtvis under 15 minuter. Warm Standby är den mest populära DR-nivån för affärskritiska applikationer.

# Production vs Warm Standby capacity:
# Tier          Production    DR Standby
# Web servers   20 EC2 (c5.xl) 2 EC2 (c5.xl)
# App servers   10 EC2 (m5.xl) 2 EC2 (m5.xl)
# Database      RDS db.r5.2xl  RDS Read Replica (db.r5.xl)
# Cache         Redis r6g.xl   Redis r6g.medium
#
# Cost: DR standby ~15% of production cost

Aurora Global Database för Warm Standby

Aurora Global Database är den idealiska databastekniken för DR med Warm Standby. Klustret i den sekundära regionen körs alltid, tar alltid emot replikering (fördröjning på <1 sekund) och kan befordras till primärt på under 1 minut — betydligt snabbare än att befordra en RDS Read Replica (vilket kräver att replikeringen stoppas och att den återstående fördröjningen tillämpas). Därför rekommenderas Aurora Global Database när ditt RTO-krav ligger på minuter snarare än tiotals minuter.

# Promote Aurora Global DB secondary to primary
# (during DR failover)
aws rds failover-global-cluster \
  --global-cluster-identifier my-global-db \
  --target-db-cluster-identifier my-aurora-cluster-us-west-2

# Aurora handles promotion automatically
# Typical promotion time: 1-2 minutes
# vs RDS Read Replica promotion: 10-30 minutes

Konfigurera automatisk failover med Route 53

Både Pilot Light och Warm Standby förlitar sig på failover-routing i Route 53 för att automatiskt omdirigera trafik. Konfigurera en Primary-post som pekar på ALB:n eller slutpunkten i produktionsregionen och koppla en hälsokontroll till den. Konfigurera en Secondary-post som pekar på slutpunkten i DR-regionen. När Route 53 upptäcker att den primära hälsokontrollen har misslyckats under den konfigurerade tröskelperioden slutar tjänsten att returnera den primära posten och tillhandahåller endast den sekundära posten — allt inom DNS TTL-perioden.

# Primary record (production)
aws route53 change-resource-record-sets \
  --hosted-zone-id ZXXX \
  --change-batch '{
    "Changes": [{
      "Action": "UPSERT",
      "ResourceRecordSet": {
        "Name": "api.example.com",
        "Type": "A",
        "Failover": "PRIMARY",
        "SetIdentifier": "primary",
        "HealthCheckId": "hc-us-east-1",
        "AliasTarget": {"DNSName": "alb-prod.us-east-1.elb.amazonaws.com","EvaluateTargetHealth": true}
      }
    }]
  }'

Förvärmning av DR-miljön

För att Warm Standby ska nå sitt RTO-mål måste DR-miljön vara förvärmd — fullständigt konfigurerad och testad, så att uppskalning under failover är den enda åtgärd som krävs. Det innebär att databasanslutningar är etablerade och cachade, att applikationens konfigurationsfiler hänvisar till slutpunkter i DR-regionen, att EC2-instanser körs bakom ALB:n (även om de är få) och att hälsokontrollerna fungerar. Genomför månatliga DR-övningar där du simulerar failover för att säkerställa att miljön hålls aktuell med produktionskonfigurationen.

# Validate DR warm standby health
# 1. Check DR ALB target health
aws elbv2 describe-target-health \
  --target-group-arn arn:aws:elasticloadbalancing:us-west-2:123:targetgroup/app-dr/xyz

# 2. Check Aurora Global DB secondary
aws rds describe-global-clusters \
  --global-cluster-identifier my-global-db

# 3. Verify Route 53 health checks
aws route53 get-health-check-status \
  --health-check-id hc-us-west-2

Infrastructure as Code för konsekvent DR

Den största operativa utmaningen är att hålla DR-miljön synkroniserad med produktionen. Om du konfigurerar produktionen manuellt och glömmer att uppdatera DR kanske DR-miljön inte fungerar korrekt under en verklig katastrof. Lösningen är Infrastructure as Code (IaC) med samma mallar distribuerade till båda regionerna. Använd AWS CloudFormation StackSets eller Terraform with multiple workspaces för att distribuera identisk infrastruktur till båda regionerna från en enda kodbas. Detta eliminerar konfigurationsdrift.

# CloudFormation StackSet: deploy to multiple regions
aws cloudformation create-stack-set \
  --stack-set-name my-app-infrastructure \
  --template-url https://s3.amazonaws.com/mybucket/template.yaml

# Deploy to DR region
aws cloudformation create-stack-instances \
  --stack-set-name my-app-infrastructure \
  --accounts 123456789012 \
  --regions us-west-2 \
  --parameter-overrides \
    ParameterKey=DesiredCapacity,ParameterValue=2

Kostnadsjämförelse: Pilot Light och Warm Standby

Kostnadsskillnaden mellan de två strategierna är betydande. Pilot Light kostar endast för databasreplikan (vanligtvis 50–100 % av kostnaden för den primära databasen) samt minimal nätverksinfrastruktur i DR-regionen. Applikationsservrarna är avstängda, så inga EC2-kostnader tillkommer. Warm Standby medför kostnader för nedskalade EC2-instanser, en ALB och eventuellt ett mindre cachekluster — vanligtvis 15–30 % av kostnaden för hela produktionsmiljön. Frågan är om den snabbare RTO:n med Warm Standby motiverar den högre löpande kostnaden.

# Example monthly cost comparison:
# Production environment: $10,000/month

# Pilot Light DR:
#   RDS Read Replica: $500/month
#   Minimal networking: $50/month
#   Total: $550/month (~5.5% of production)

# Warm Standby DR:
#   RDS Read Replica: $500/month
#   2x EC2 instances: $400/month
#   ALB + networking: $200/month
#   Total: $1,100/month (~11% of production)

Failback: Återgång till primärregionen

När primärregionen har återställts behöver ni en plan för failback så att ni kan återgå till den. Failback är ofta den mest komplicerade delen av DR: under avbrottet kan DR-regionen ha behandlat nya data som måste synkroniseras tillbaka till primärregionen. För databaser kan ni behöva konfigurera omvänd replikering eller synkronisera om från DR till primärregionen. För Route 53 återställer ni den primära posten med dess hälsokontroll. Planera och testa alltid er failback-procedur lika noggrant som själva failover-proceduren.

# Failback procedure steps:
# 1. Restore primary region infrastructure
# 2. Set up replication from DR to primary
#    (reverse replication to sync new data)
# 3. Verify data consistency
# 4. Re-enable primary Route 53 health check
# 5. Gradually shift traffic back (weighted routing)
#    Route 53 weights: Primary=10%, DR=90%
#                      Primary=50%, DR=50%
#                      Primary=100%, DR=0%
# 6. Decommission DR region back to standby capacity

När ska ni välja Pilot Light respektive Warm Standby

Välj Pilot Light när: ert RTO tillåter 30–60 minuter och ni vill minimera DR-kostnaderna. Den största risken är tiden som krävs för att starta och konfigurera applikationsservrar under press vid en katastrof. Välj Warm Standby när: ert RTO kräver återställning inom 15 minuter, applikationen är tillräckligt komplex för att det ska vara riskabelt att starta den från grunden under en katastrof, eller ert SLA-åtagande gentemot kunderna kräver snabbare återställning. För de flesta produktionsarbetsbelastningar med medelhög kritikalitet är Warm Standby den bästa avvägningen.

# Decision guide:
# RTO > 1 hour:  Backup and Restore
# RTO 30-60 min: Pilot Light
# RTO 5-15 min:  Warm Standby
# RTO < 5 min:   Multi-Site Active-Active

# Additional factors for Warm Standby:
# - Complex application startup procedures
# - Contractual SLA commitments to customers
# - High revenue loss per minute of downtime
# - Regulatory requirements for fast recovery

Snabbtest

Testa er förståelse av AWS Solutions Architect-koncepten (SAA-C03) från den här lektionen.

Lektionens sammanfattning

I den här lektionen lärde ni er att Pilot Light endast håller databasen igång i DR och startar applikationsservrar under failover, att Warm Standby kör en komplett, nedskalad miljö som skalas upp under failover och att Infrastructure as Code förhindrar konfigurationsdrift mellan primära miljöer och DR-miljöer. Planera och testa alltid failback-procedurer såväl som failover-procedurer. Härnäst utforskar vi multi-site active-active med DynamoDB Global Tables och Route 53.

Gratis att börja

Lär dig AWS Solutions Architect med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Pilot Light och varm reservmiljö” gratis?

Ja – du kan läsa vilka 3 lektioner som helst i lärvägen AWS Solutions Architect, inklusive ”Pilot Light och varm reservmiljö”, kostnadsfritt i sin helhet här på webben. Därefter låser CoddyKit PRO upp alla lektioner, plus interaktiv övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Kursen i AWS Solutions Architect innehåller totalt 4 lektioner.

Vad lär jag mig i ”Pilot Light och varm reservmiljö”?

Håll en minimal kärna av arbetsbelastningen igång i en andra region (pilot light) eller en nedskalad men fullt fungerande kopia (varm reservmiljö) som är redo att skalas upp. Ni övar på AWS Solutions Architect med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig AWS Solutions Architect?

Du behöver inga förkunskaper. Utbildningen i AWS Solutions Architect på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 3 av 4.

Hur lång tid tar lektionen ”Pilot Light och varm reservmiljö”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här AWS Solutions Architect-lektionen?

Ja. Varje AWS Solutions Architect-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. RTO, RPO och DR-nivåer
  2. Säkerhetskopiering och återställning
  3. Pilot Light och varm reservmiljö
  4. Multi-Site Active-Active med Global Tables och Route 53
← Tillbaka till AWS Solutions Architect