Planes de recuperación y conmutación por error automatizada
Cree un plan de recuperación de ASR que secuencie la conmutación por error de las máquinas virtuales en las distintas capas de la aplicación, añada puntos de aprobación manual e incluya scripts previos y posteriores a la conmutación.
Planes de recuperación y conmutación por error automatizada es una lección gratuita de Cloud & IT Cert Prep en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Cloud & IT Cert Prep, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Cloud & IT Cert Prep incluye 4 lecciones en total.
¿Qué es un plan de recuperación de ASR?
Un plan de recuperación de Azure Site Recovery es una secuencia estructurada y ordenada de pasos que coordina la conmutación por error conjunta de varias máquinas virtuales. En lugar de conmutar por error cada máquina virtual individualmente, un plan de recuperación las agrupa en grupos que realizan la conmutación por error en secuencia, lo que garantiza que la infraestructura (base de datos, middleware y web) se inicie en el orden correcto, tal como ocurriría durante la implementación inicial.
Creación de un plan de recuperación
Para crear un plan de recuperación, seleccione el sitio de origen (región principal) y el sitio de destino (región secundaria) y, a continuación, agregue las máquinas virtuales que desea incluir. El asistente del plan crea automáticamente un grupo predeterminado, pero puede agregar más grupos para controlar la secuencia de conmutación por error. Las máquinas virtuales del mismo grupo realizan la conmutación por error simultáneamente; los grupos se ejecutan en el orden numérico indicado.
# Create an ASR Recovery Plan via CLI:
az site-recovery recovery-plan create \
--resource-group myRG \
--vault-name myRecoveryVault \
--name myRecoveryPlan \
--primary-fabric-id '/subscriptions/.../replicationFabrics/eastus' \
--recovery-fabric-id '/subscriptions/.../replicationFabrics/westus' \
--groups '[{"groupType":"Boot","replicationProtectedItems":[...]}]'Secuenciación de grupos para aplicaciones multinivel
Para una aplicación típica de tres niveles, el plan de recuperación debe tener tres grupos:
- Grupo 1 — máquinas virtuales del nivel de base de datos (deben iniciarse primero)
- Grupo 2 — máquinas virtuales del nivel de aplicación o middleware
- Grupo 3 — máquinas virtuales del frontend web (se inician al final)
Cada grupo espera a que el grupo anterior complete correctamente la conmutación por error antes de iniciarse. Esto reproduce el orden correcto de inicio y evita que las máquinas virtuales del nivel web se inicien antes de que la base de datos esté lista para aceptar conexiones.
Adición de acciones manuales y scripts
Los planes de recuperación admiten acciones previas y acciones posteriores en cada límite entre grupos. Estas pueden ser:
- Acciones manuales — pausar la conmutación por error y esperar a que una persona la confirme (por ejemplo, «Comprobar que la base de datos está lista»)
- runbooks de Azure Automation — ejecutar automáticamente un script (por ejemplo, actualizar los registros DNS o deshabilitar el modo de mantenimiento)
El uso de runbooks de Automation permite realizar una conmutación por error totalmente automatizada, sin intervención humana, para las cargas de trabajo de nivel 1.
# Example Automation runbook action in a recovery plan:
# Pre-group-2 action: Run runbook 'UpdateConnectionStrings'
# This runbook updates app config to point to secondary DB endpoint
# before the application tier VMs startConmutación por error planeada frente a no planeada
Azure Site Recovery admite dos tipos de conmutación por error:
- Conmutación por error planeada — se inicia antes de un evento conocido (por ejemplo, el mantenimiento del centro de datos). La máquina virtual principal se apaga correctamente, los datos se sincronizan y, a continuación, se inicia la máquina virtual secundaria. No se pierden datos.
- Conmutación por error no planeada — se desencadena durante un desastre real. Es posible que la máquina virtual principal no esté disponible, por lo que ASR utiliza el punto de control de replicación más reciente. Puede producirse cierta pérdida de datos, según el RPO.
# Trigger an unplanned failover via CLI:
az site-recovery recovery-plan failover-unplanned \
--resource-group myRG \
--vault-name myRecoveryVault \
--name myRecoveryPlan \
--failover-direction PrimaryToRecoveryConfirmación y conmutación por recuperación
Después de una conmutación por error, las máquinas virtuales recuperadas en la región secundaria se encuentran en un estado de confirmación pendiente. Debe confirmar la conmutación por error para indicar que el sitio secundario es ahora el sitio activo y que no desea revertir la operación. Una vez confirmada, puede configurar la replicación inversa para proteger el sitio secundario y, finalmente, realizar la conmutación por recuperación a la región principal cuando esta se haya restaurado.
# Commit the failover:
az site-recovery recovery-plan commit \
--resource-group myRG \
--vault-name myRecoveryVault \
--name myRecoveryPlan
# Then configure reverse replication to enable failback laterRestablecimiento de la protección después de una conmutación por error
Después de confirmar una conmutación por error, los elementos replicados en la región principal original dejan de replicarse activamente. Para restaurar la protección, debe restablecer la protección de los elementos, lo que invierte la dirección de replicación para que la nueva región principal (antes secundaria) replique los datos en la región principal original. El restablecimiento de la protección lleva tiempo y debe iniciarse en cuanto la región principal original vuelva a estar disponible.
Medición del RTO en los planes de recuperación
Cada paso de un plan de recuperación contribuye al RTO total. Entre los principales consumidores de tiempo se incluyen:
- Tiempo de inicio de las VM (2-5 minutos por VM)
- Tiempo de preparación de la aplicación (inicialización del grupo de conexiones de la base de datos y calentamiento de la caché)
- Propagación de DNS después de los cambios de IP
- Tiempo de espera de las puertas de aprobación manual
Mida cada paso durante las conmutaciones por error de prueba y súmelos para calcular su RTO real y compararlo con el objetivo.
Automatización de las actualizaciones de DNS
Después de una conmutación por error, las VM de la región secundaria tienen direcciones IP diferentes. En el caso de las aplicaciones que exponen un nombre DNS público, debe actualizar el DNS para que apunte a las nuevas IP. Use un runbook de Azure Automation como acción posterior a la conmutación por error para actualizar Azure DNS o el estado de los puntos de conexión de Traffic Manager y redirigir el tráfico automáticamente, evitando un paso manual que podría retrasar el RTO.
# Example: Update Azure DNS record in a runbook after failover:
# az network dns record-set a update \
# --resource-group dnsRG \
# --zone-name myapp.com \
# --record-set-name '@' \
# --set 'ARecords[0].ipv4Address=<new-secondary-ip>'Supervisión de la ejecución del plan de recuperación
Durante una conmutación por error, la vista de trabajos del portal de Azure en el almacén de Recovery Services muestra en tiempo real el progreso de cada paso del plan de recuperación. Puede ver qué grupo se está ejecutando, qué VM se han iniciado correctamente y si hay scripts o acciones manuales pendientes. Supervisar esta vista permite al equipo de recuperación intervenir rápidamente si falla algún paso.
Procedimientos recomendados para los planes de recuperación
Estos son algunos procedimientos recomendados clave para los planes de recuperación:
- Mantenga los grupos pequeños (5-10 VM) para limitar el radio de impacto si un grupo falla
- Use runbooks de Automation en lugar de acciones manuales siempre que sea posible para reducir el RTO
- Documente el tiempo de inicio previsto de cada grupo para poder calcular el RTO
- Ejecute una conmutación por error de prueba al menos trimestralmente para validar el plan
- Revise y actualice el plan cada vez que agregue nuevas VM o cambie la arquitectura de la aplicación
Comprobación rápida
Ponga a prueba sus conocimientos sobre los conceptos de Microsoft Azure Fundamentals (AZ-900) de esta lección.
Resumen de la lección
En esta lección ha aprendido que un plan de recuperación coordina la conmutación por error ordenada de varias VM, con acciones previas y posteriores en cada grupo; la conmutación por error no planeada usa el último punto de comprobación de replicación, mientras que la conmutación por error planeada no implica ninguna pérdida de datos; y, después de una conmutación por error, debe confirmar y volver a proteger los recursos para restaurar la protección de DR. A continuación, exploraremos cómo probar los planes de DR sin afectar al entorno de producción.
Preguntas frecuentes
¿La lección «Planes de recuperación y conmutación por error automatizada» es gratis?
Sí — el texto completo de «Planes de recuperación y conmutación por error automatizada» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Cloud & IT Cert Prep, actualiza a CoddyKit PRO. El curso de Cloud & IT Cert Prep incluye 4 lecciones en total.
¿Qué aprenderé en «Planes de recuperación y conmutación por error automatizada»?
Cree un plan de recuperación de ASR que secuencie la conmutación por error de las máquinas virtuales en las distintas capas de la aplicación, añada puntos de aprobación manual e incluya scripts previ… Practicas Cloud & IT Cert Prep con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Cloud & IT Cert Prep?
No se requiere experiencia previa. Cloud & IT Cert Prep en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.
¿Cuánto tiempo toma la lección «Planes de recuperación y conmutación por error automatizada»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Cloud & IT Cert Prep?
Sí. Cada lección de Cloud & IT Cert Prep incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Definición de RTO, RPO y niveles de recuperación
- Planes de recuperación y conmutación por error automatizada
- Pruebas de recuperación ante desastres sin impacto
- Recuperación ante desastres para servicios PaaS