0Pricing
Cloud & IT Cert Prep · 강의

복구 계획과 자동 장애 조치

애플리케이션 계층 전반의 VM 장애 조치를 순서대로 실행하는 ASR 복구 계획을 만들고, 수동 승인 단계를 추가하며, 장애 조치 전후 스크립트를 포함합니다.

복구 계획과 자동 장애 조치은(는) CoddyKit의 무료 Cloud & IT Cert Prep 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Cloud & IT Cert Prep 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Cloud & IT Cert Prep 강의에는 총 4개의 강의가 포함되어 있습니다.

ASR Recovery Plan이란?

Azure Site Recovery의 Recovery Plan은 여러 VM의 장애 조치를 함께 조정하는 구조화된 단계의 순서입니다. 각 VM을 개별적으로 장애 조치하는 대신, Recovery Plan은 VM을 그룹으로 묶어 순서대로 장애 조치합니다. 이를 통해 초기 배포 때와 마찬가지로 인프라(데이터베이스, 미들웨어, 웹)가 올바른 순서로 시작됩니다.

Recovery Plan 만들기

Recovery Plan을 만들려면 원본 사이트(주 지역)와 대상 사이트(보조 지역)를 선택한 다음 포함할 VM을 추가합니다. 마법사가 기본 그룹을 자동으로 만들지만, 장애 조치 순서를 제어하기 위해 그룹을 더 추가할 수 있습니다. 같은 그룹의 VM은 동시에 장애 조치되고, 그룹은 번호 순서대로 실행됩니다.

# Create an ASR Recovery Plan via CLI:
az site-recovery recovery-plan create \
  --resource-group myRG \
  --vault-name myRecoveryVault \
  --name myRecoveryPlan \
  --primary-fabric-id '/subscriptions/.../replicationFabrics/eastus' \
  --recovery-fabric-id '/subscriptions/.../replicationFabrics/westus' \
  --groups '[{"groupType":"Boot","replicationProtectedItems":[...]}]'

다중 계층 앱을 위한 그룹 순서 지정

일반적인 3계층 애플리케이션의 Recovery Plan에는 다음과 같은 세 그룹이 있어야 합니다.

  • 그룹 1 — 데이터베이스 계층 VM(가장 먼저 시작해야 함)
  • 그룹 2 — 애플리케이션/미들웨어 계층 VM
  • 그룹 3 — 웹 프런트 엔드 VM(가장 나중에 시작)

각 그룹은 이전 그룹의 장애 조치가 성공적으로 완료될 때까지 기다린 후 시작합니다. 이렇게 하면 올바른 시작 순서를 따를 수 있으며, 데이터베이스가 연결을 수락할 준비가 되기 전에 웹 계층 VM이 시작되는 것을 방지할 수 있습니다.

수동 작업 및 스크립트 추가

Recovery Plan은 각 그룹 경계에서 사전 작업과 사후 작업을 지원합니다. 다음과 같은 작업을 사용할 수 있습니다.

  • 수동 작업 — 장애 조치를 일시 중지하고 담당자가 확인할 때까지 기다립니다(예: ‘데이터베이스가 준비되었는지 확인’).
  • Azure Automation 런북 — 스크립트를 자동으로 실행합니다(예: DNS 레코드 업데이트, 유지 관리 모드 해제).

Automation 런북을 사용하면 계층 1 워크로드에서 사람의 개입 없이 완전히 자동화된 장애 조치를 수행할 수 있습니다.

# Example Automation runbook action in a recovery plan:
# Pre-group-2 action: Run runbook 'UpdateConnectionStrings'
# This runbook updates app config to point to secondary DB endpoint
# before the application tier VMs start

계획된 장애 조치와 계획되지 않은 장애 조치

Azure Site Recovery는 두 가지 장애 조치 유형을 지원합니다.

  • 계획된 장애 조치 — 알려진 이벤트(예: 데이터 센터 유지 관리) 전에 시작합니다. 주 VM을 정상적으로 종료하고 데이터를 동기화한 다음 보조 VM을 시작합니다. 데이터 손실이 없습니다.
  • 계획되지 않은 장애 조치 — 실제 재해가 발생했을 때 시작됩니다. 주 VM을 사용할 수 없을 수 있으므로 ASR은 가장 최근의 복제 검사점을 사용합니다. RPO에 따라 일부 데이터가 손실될 수 있습니다.
# Trigger an unplanned failover via CLI:
az site-recovery recovery-plan failover-unplanned \
  --resource-group myRG \
  --vault-name myRecoveryVault \
  --name myRecoveryPlan \
  --failover-direction PrimaryToRecovery

Commit 및 장애 복귀

장애 조치 후 보조 지역에서 복구된 VM은 커밋 대기 상태가 됩니다. 보조 사이트가 이제 활성 사이트이며 롤백하지 않겠다는 것을 확인하려면 장애 조치를 Commit해야 합니다. Commit이 완료되면 역방향 복제을 설정하여 보조 사이트를 보호하고, 주 지역이 복구된 후 최종적으로 주 지역으로 장애 복귀할 수 있습니다.

# Commit the failover:
az site-recovery recovery-plan commit \
  --resource-group myRG \
  --vault-name myRecoveryVault \
  --name myRecoveryPlan

# Then configure reverse replication to enable failback later

장애 조치 후 재보호

장애 조치를 Commit한 후 원래 주 지역의 복제 항목은 더 이상 활발하게 복제되지 않습니다. 보호를 복원하려면 항목을 재보호해야 합니다. 이렇게 하면 복제 방향이 반전되어 새 주 지역(이전의 보조 지역)이 원래 주 지역으로 복제합니다. 재보호에는 시간이 걸리므로 원래 주 지역을 다시 사용할 수 있게 되는 즉시 시작해야 합니다.

복구 계획의 RTO 측정

복구 계획의 각 단계는 전체 RTO에 더해집니다. 일반적으로 다음 작업에 시간이 소요됩니다.

  • VM 시작 시간(VM당 2~5분)
  • 애플리케이션 준비 시간(데이터베이스 연결 풀 초기화, 캐시 준비)
  • IP 변경 후 DNS 전파
  • 수동 승인 게이트 대기 시간

Test 장애 조치 중에 각 단계의 시간을 측정하고 합산하여 목표와 비교할 실제 RTO를 계산합니다.

DNS 업데이트 자동화

장애 조치 후 보조 지역의 VM에는 서로 다른 IP 주소가 할당됩니다. 공용 DNS 이름을 노출하는 애플리케이션의 경우 DNS를 업데이트하여 새 IP를 가리키도록 해야 합니다. 장애 조치 후 작업으로 Azure Automation runbook을 사용하여 Azure DNS 또는 Traffic Manager 엔드포인트 상태를 업데이트하면 트래픽이 자동으로 리디렉션되므로 RTO를 지연시킬 수 있는 수동 단계를 피할 수 있습니다.

# Example: Update Azure DNS record in a runbook after failover:
# az network dns record-set a update \
#   --resource-group dnsRG \
#   --zone-name myapp.com \
#   --record-set-name '@' \
#   --set 'ARecords[0].ipv4Address=<new-secondary-ip>'

복구 계획 실행 모니터링

장애 조치 중에는 Recovery Services 자격 증명 모음의 Azure portal Jobs 보기에 복구 계획의 각 단계에 대한 실시간 진행 상황이 표시됩니다. 어떤 그룹이 실행 중인지, 어떤 VM이 성공적으로 시작되었는지, 스크립트나 수동 작업이 대기 중인지 확인할 수 있습니다. 이 보기를 모니터링하면 단계가 실패할 때 복구 팀이 신속하게 개입할 수 있습니다.

복구 계획 모범 사례

복구 계획의 주요 모범 사례는 다음과 같습니다.

  • 그룹을 작게 유지하여(5~10개 VM) 그룹이 실패했을 때 영향 범위를 제한합니다.
  • 가능한 경우 수동 작업 대신 Automation runbook을 사용하여 RTO를 줄입니다.
  • RTO를 계산할 수 있도록 각 그룹의 예상 시작 시간을 문서화합니다.
  • 계획을 검증하기 위해 최소 분기별로 Test 장애 조치를 실행합니다.
  • 새 VM이 추가되거나 애플리케이션 아키텍처가 변경될 때마다 계획을 검토하고 업데이트합니다.

빠른 확인

이 단원에서 다룬 Microsoft Azure Fundamentals (AZ-900) 개념에 대한 이해도를 확인합니다.

단원 요약

이 단원에서는 다음을 배웠습니다. 복구 계획은 각 그룹에서 사전 및 사후 작업을 수행하면서 여러 VM의 장애 조치를 정해진 순서로 조정합니다. 계획되지 않은 장애 조치는 마지막 복제 체크포인트를 사용하고, 계획된 장애 조치는 데이터 손실이 없습니다. 또한 장애 조치 후에는 DR 보호를 복원하기 위해 커밋하고 재보호해야 합니다. 다음 단원에서는 프로덕션에 영향을 주지 않고 DR 계획을 테스트하는 방법을 살펴봅니다.

자주 묻는 질문

“복구 계획과 자동 장애 조치” 강의는 무료인가요?

네 — “복구 계획과 자동 장애 조치” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Cloud & IT Cert Prep 강의 전체를 잠금 해제할 수 있습니다. Cloud & IT Cert Prep 강의에는 총 4개의 강의가 포함되어 있습니다.

“복구 계획과 자동 장애 조치”에서 뭘 배우나요?

애플리케이션 계층 전반의 VM 장애 조치를 순서대로 실행하는 ASR 복구 계획을 만들고, 수동 승인 단계를 추가하며, 장애 조치 전후 스크립트를 포함합니다. 브라우저에서 직접 실행하는 실습 코드로 Cloud & IT Cert Prep을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

Cloud & IT Cert Prep을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 Cloud & IT Cert Prep은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“복구 계획과 자동 장애 조치” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 Cloud & IT Cert Prep 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 Cloud & IT Cert Prep 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. RTO, RPO 및 복구 계층 정의
  2. 복구 계획과 자동 장애 조치
  3. 영향 없이 DR 테스트하기
  4. PaaS 서비스의 DR
← Cloud & IT Cert Prep(으)로 돌아가기