0Pricing
AWS Solutions Architect · 강의

RTO, RPO 및 DR 계층

복구 시간 목표와 복구 시점 목표를 정의하고 비용 계층에 매핑하며, 각 DR 전략이 지원하는 SLA 약정을 이해합니다.

RTO, RPO 및 DR 계층은(는) CoddyKit의 무료 AWS Solutions Architect 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AWS Solutions Architect 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AWS Solutions Architect 강의에는 총 4개의 강의가 포함되어 있습니다.

RTO와 RPO 이해하기

Recovery Time Objective (RTO)는 재해가 발생한 시점부터 시스템을 운영 상태로 복구할 때까지 허용되는 최대 시간입니다. RTO가 4시간이면 비즈니스는 4시간의 중단을 감내할 수 있습니다. Recovery Point Objective (RPO)는 시간으로 측정한 허용 가능한 최대 데이터 손실량입니다. RPO가 1시간이면 재해 발생 시점보다 1시간 이상 이전의 지점으로는 복구할 수 있어야 합니다. 두 지표 모두 기술적 선호가 아니라 비즈니스 요구 사항에 따라 정의됩니다.

# RTO and RPO definitions:
# RTO = max time system can be DOWN
#   Example: RTO=4h means restore within 4 hours
#
# RPO = max data LOSS acceptable
#   Example: RPO=1h means no more than 1 hour of data lost
#
# Lower RTO and RPO = more expensive DR strategy
# Higher RTO and RPO = cheaper but more business impact

네 가지 DR 계층

AWS는 비용이 가장 낮고 RTO가 가장 긴 방식부터 비용이 가장 높고 RTO가 가장 짧은 방식 순으로 네 가지 주요 재해 복구 전략을 정의합니다. 1) Backup 및 Restore — 가장 저렴하며 RTO는 수 시간입니다. 2) Pilot Light — 최소한의 핵심 구성 요소만 항상 실행하며 RTO는 수 분에서 수 시간입니다. 3) Warm Standby — 규모는 축소되었지만 작동하는 환경이며 RTO는 수 분입니다. 4) Multi-Site Active-Active — 가장 비싸지만 RTO가 거의 0입니다. 어떤 전략을 선택할지는 중단으로 인한 비즈니스 비용과 DR 인프라 비용 중 어느 쪽이 더 큰지에 따라 달라집니다.

# DR Strategy comparison:
# Strategy          | RTO      | RPO      | Cost
# Backup & Restore  | Hours    | Hours    | Lowest
# Pilot Light       | Minutes+ | Minutes  | Low
# Warm Standby      | Minutes  | Seconds  | Medium
# Active-Active     | ~0       | ~0       | Highest

Backup 및 Restore 전략

Backup 및 Restore에서는 데이터를 정기적으로 스냅샷으로 저장하고 다른 위치에 보관합니다(예: 리전 간 복제를 적용한 S3). 재해가 발생하면 가장 최근의 백업에서 복원합니다. 대기 인프라를 실행하지 않으므로 가장 저렴한 전략입니다. 대신 RTO가 가장 길고(스냅샷에서 대규모 데이터베이스를 복원하는 데 수 시간이 걸림), RPO가 가장 높습니다(마지막 백업 이후의 데이터가 손실됨). AWS Backup은 EC2, RDS, EFS, DynamoDB 등의 스냅샷 일정을 자동화합니다.

# Create AWS Backup plan for RDS
aws backup create-backup-plan \
  --backup-plan '{
    "BackupPlanName": "daily-backup",
    "Rules": [{
      "RuleName": "daily",
      "TargetBackupVaultName": "dr-vault",
      "ScheduleExpression": "cron(0 5 ? * * *)",
      "StartWindowMinutes": 60,
      "CompletionWindowMinutes": 180,
      "Lifecycle": {
        "DeleteAfterDays": 35
      },
      "CopyActions": [{
        "DestinationBackupVaultArn": "arn:aws:backup:us-west-2:123:backup-vault:dr-vault"
      }]
    }]
  }'

Pilot Light 전략

Pilot Light 전략은 DR 리전에서 시스템의 핵심 구성 요소를 최소 용량으로 실행합니다. 이는 전체 불꽃을 빠르게 키울 수 있는 파일럿 불빛과 같습니다. 일반적으로 DR 리전에 데이터베이스를 지속적으로 복제하고 기본 네트워크 인프라(VPC, 서브넷, 보안 그룹)를 유지합니다. 애플리케이션 서버는 실행하지 않지만 사전 구축된 AMI 또는 시작 템플릿으로 신속하게 시작할 수 있습니다. RTO는 필요한 수동 작업의 양에 따라 일반적으로 30분에서 수 시간입니다.

# Pilot Light: what runs in DR region at all times
# - RDS Read Replica (continuously replicated)
# - Core VPC/networking infrastructure
# - Route 53 DNS (inactive until failover)

# What is NOT running (launched during failover):
# - EC2 application servers
# - ELB (or dormant)

# Failover steps:
# 1. Promote RDS Read Replica to standalone
# 2. Scale up EC2 instances from launch template
# 3. Update Route 53 to point to DR region

Warm Standby 전략

Warm Standby 전략은 DR 리전에서 운영 환경의 완전히 작동하는 축소 복사본을 실행합니다. Pilot Light와 달리 애플리케이션 계층이 실행 중이며(예를 들어 인스턴스 20개 대신 1~2개), 데이터베이스는 Aurora Global Database 보조 데이터베이스 또는 RDS Read Replica입니다. 장애 조치 중에는 DR 환경을 확장하여 운영 환경의 용량에 맞춥니다. RTO는 일반적으로 15분 이내입니다. 이는 중요도가 중간에서 높은 워크로드에 가장 일반적인 DR 전략입니다.

# Warm Standby: DR region runs scaled-down version
# Production:  10 EC2 instances (ASG min=10, max=50)
# DR Standby:  2 EC2 instances  (ASG min=2,  max=50)

# During failover:
# 1. Route 53 health check fails for primary
# 2. DNS switches to DR ALB
# 3. ASG in DR scales up from 2 to 10+
# 4. Promote Aurora Global DB secondary
# Total failover time: ~5-15 minutes

Multi-Site Active-Active 전략

Multi-Site Active-Active는 두 개 이상의 리전에서 전체 운영 용량을 동시에 실행합니다. 모든 리전이 실시간 트래픽을 처리하고 데이터는 거의 실시간으로(또는 다중 마스터 방식으로) 복제됩니다. 장애 조치 지연이 없습니다. 한 리전에 장애가 발생하면 Route 53 또는 Global Accelerator가 남아 있는 정상 리전으로 모든 트래픽을 즉시 라우팅합니다. 이 방식은 RTO와 RPO가 가장 낮지만, 항상 모든 리전에서 전체 운영 용량을 유지해야 하므로 비용도 가장 높습니다.

# Active-Active: full capacity in both regions
# us-east-1:  ASG 10 instances (serving ~50% traffic)
# eu-west-1:  ASG 10 instances (serving ~50% traffic)

# Route 53 weighted routing:
# us-east-1: weight=50
# eu-west-1: weight=50
# Both records have health checks

# On us-east-1 failure:
# Health check fails -> Route 53 removes us-east-1
# eu-west-1 receives 100% traffic
# ASG in eu-west-1 scales up automatically

RPO와 데이터 복제 기술

RPO에 따라 필요한 복제 기술이 직접 결정됩니다. RPO = 0에는 동기식 복제가 필요하며 데이터가 전혀 손실되지 않습니다. RPO가 수 초라면 Aurora Global Database(<1초 지연)와 같은 거의 실시간 비동기 복제가 필요합니다. RPO가 수 분이면 약간의 지연을 허용하는 비동기 복제(DynamoDB Streams, RDS Read Replicas)를 사용할 수 있습니다. RPO가 수 시간이면 주기적인 스냅샷(AWS Backup 시간별 일정)으로 달성할 수 있습니다. 기술을 선택하기 전에 비즈니스 RPO 요구 사항을 명확히 정하십시오.

# RPO requirements mapped to replication technology:
# RPO = 0:        RDS Multi-AZ (synchronous)
# RPO < 1 second: Aurora Global Database
# RPO < 1 minute: DynamoDB Global Tables
# RPO < 15 min:   RDS Read Replica
# RPO < 1 hour:   AWS Backup hourly schedule
# RPO < 24 hours: AWS Backup daily schedule

서버리스 아키텍처를 위한 DR

서버리스 아키텍처(Lambda, DynamoDB, API Gateway)는 본질적으로 복원력이 높지만 여전히 DR 계획이 필요합니다. DynamoDB Global Tables는 데이터베이스 계층에 액티브-액티브 다중 리전을 제공합니다. Lambda는 동일한 CI/CD 파이프라인에서 두 번째 리전에 배포할 수 있습니다. API Gateway는 DR 리전에 프로비저닝해야 합니다. 가장 큰 위험은 리전 간 구성 드리프트입니다. AWS CDK 또는 Terraform을 사용하여 동일한 코드 베이스에서 두 리전에 동일한 인프라를 배포하십시오.

# Deploy Lambda to multiple regions with CDK
# cdk.json environment configuration:
{
  'primary': {
    'account': '123456789',
    'region': 'us-east-1'
  },
  'dr': {
    'account': '123456789',
    'region': 'us-west-2'
  }
}

# Deploy to both:
# cdk deploy --context env=primary
# cdk deploy --context env=dr

RTO와 비용 간 상충 관계 예시

연간 매출이 1,000만 달러인 회사를 생각해 보겠습니다. 중단 비용이 분당 1,000달러라면 8시간의 중단(RTO=8시간)으로 480,000달러의 비용이 발생합니다. RTO=15분인 액티브-패시브 Warm Standby를 사용하면 사고당 잠재적 손실을 15,000달러로 줄일 수 있습니다. 대기 환경 비용이 월 5,000달러(연 60,000달러)라면 연간 중대한 중단이 한 번을 초과할 때만 경제적으로 타당합니다. 이 비용 정당성 분석은 SAA-C03 시험에서 DR 전략을 선택할 때 수행하도록 요구하는 바로 그 분석입니다.

# DR cost justification formula:
# Annual cost of DR infrastructure
# vs
# Expected annual outage cost
#   = P(outage) x downtime_duration x cost_per_minute
#
# Example:
# P(annual outage) = 0.1 (10% chance per year)
# downtime = 8 hours = 480 minutes
# cost = $1000/min
# Expected loss = 0.1 x 480 x $1000 = $48,000/year
#
# If warm standby costs $30,000/year -> worth it

DR 테스트 및 문서화

한 번도 테스트하지 않은 DR 계획은 문서에 불과합니다. AWS는 정기적인 DR 훈련을 강력히 권장합니다. 장애 조치 절차를 연습하고, 실제 RTO와 RPO를 측정하며, 부족한 부분을 파악하십시오. AWS Fault Injection Simulator (FIS)를 사용하여 통제된 방식으로 리전 성능 저하를 시뮬레이션하십시오. 장애 조치 단계를 설명하는 운영 절차서를 작성하여 실제 사고의 압박 속에서도 대기 담당 팀이 즉흥적으로 대응하지 않고 명확하게 검증된 절차를 따르도록 하십시오.

# DR drill checklist:
# 1. Notify stakeholders (planned drill)
# 2. Initiate failover (Route 53 health check override)
# 3. Measure time from trigger to traffic in DR region (RTO)
# 4. Measure data consistency between regions (RPO)
# 5. Test all critical application functions in DR
# 6. Failback to primary region
# 7. Document actual RTO/RPO vs target
# 8. Update runbooks with lessons learned

규정 준수 및 DR 요구 사항

많은 산업에는 DR에 관한 규제 요구 사항이 있습니다. PCI DSS는 문서화된 DR 계획과 테스트를 요구합니다. HIPAA는 데이터 백업 및 재해 복구 절차를 요구합니다. SOC 2는 DR을 포함한 가용성 제어를 평가합니다. AWS Config와 AWS Audit Manager를 사용하여 DR 리소스(백업, 복제본, 상태 확인)가 올바르게 구성되었는지 지속적으로 평가하고 문서화하십시오. 이렇게 하면 수동으로 자료를 수집하지 않고도 규정 준수 감사의 증거를 제공할 수 있습니다.

# AWS Config rule to check RDS backup retention
aws configservice put-config-rule \
  --config-rule '{
    "ConfigRuleName": "rds-backup-enabled",
    "Source": {
      "Owner": "AWS",
      "SourceIdentifier": "DB_INSTANCE_BACKUP_ENABLED"
    },
    "InputParameters": "{\"backupRetentionMinimum\":\"7\"}"
  }'

빠른 확인

이번 레슨에서 배운 AWS Solutions Architect (SAA-C03) 개념을 얼마나 이해했는지 확인해 보세요.

레슨 요약

이번 레슨에서는 다음을 배웠습니다. RTO는 허용 가능한 최대 다운타임이고 RPO는 허용 가능한 최대 데이터 손실입니다. 네 가지 DR 계층은 비용과 복구 속도 사이의 균형을 맞춥니다. 또한 RPO 요구 사항에 따라 사용할 복제 기술이 결정됩니다. 실제 RTO와 RPO를 검증하려면 항상 DR 계획을 테스트해야 합니다. 다음으로 Backup and Restore 전략을 자세히 살펴보겠습니다.

자주 묻는 질문

“RTO, RPO 및 DR 계층” 강의는 무료인가요?

네 — “RTO, RPO 및 DR 계층” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AWS Solutions Architect 강의 전체를 잠금 해제할 수 있습니다. AWS Solutions Architect 강의에는 총 4개의 강의가 포함되어 있습니다.

“RTO, RPO 및 DR 계층”에서 뭘 배우나요?

복구 시간 목표와 복구 시점 목표를 정의하고 비용 계층에 매핑하며, 각 DR 전략이 지원하는 SLA 약정을 이해합니다. 브라우저에서 직접 실행하는 실습 코드로 AWS Solutions Architect을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AWS Solutions Architect을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AWS Solutions Architect은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“RTO, RPO 및 DR 계층” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AWS Solutions Architect 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AWS Solutions Architect 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. RTO, RPO 및 DR 계층
  2. 백업 및 복원
  3. 파일럿 라이트 및 웜 대기
  4. Global Tables 및 Route 53을 사용한 다중 사이트 액티브-액티브
← AWS Solutions Architect(으)로 돌아가기