0Pricing
Cloud & IT Cert Prep · Lección

Pilares de fiabilidad y eficiencia del rendimiento

Diseñe para la recuperación automática, el escalado horizontal y la gestión de capacidad; elija los tipos de recursos adecuados y supervise el sistema para mantener el rendimiento a lo largo del tiempo

Pilares de fiabilidad y eficiencia del rendimiento es una lección gratuita de Cloud & IT Cert Prep en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Cloud & IT Cert Prep, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Cloud & IT Cert Prep incluye 4 lecciones en total.

Descripción general del pilar de Fiabilidad

El pilar de Fiabilidad del Well-Architected Framework garantiza que una carga de trabajo realice su función prevista de forma correcta y coherente cuando sea necesario. La fiabilidad abarca tres áreas: fundamentos (límites de servicio y topología de red), arquitectura de la carga de trabajo (sistemas distribuidos y evitar los SPOF) y gestión de cambios y fallos (supervisión, escalado y recuperación ante fallos). El objetivo es crear sistemas que se recuperen automáticamente de las interrupciones de la infraestructura o de los servicios.

# Reliability design principles:
# 1. Automatically recover from failure
# 2. Test recovery procedures
# 3. Scale horizontally to increase availability
# 4. Stop guessing capacity (use auto scaling)
# 5. Manage change in automation (IaC + CI/CD)

# Key AWS services for reliability:
# - Auto Scaling Groups
# - Elastic Load Balancing
# - Route 53 health checks
# - AWS Backup

Límites y cuotas de servicio

AWS aplica cuotas de servicio (antes denominadas límites) a los recursos para proteger a todos los clientes. Por ejemplo, existen límites predeterminados de instancias de EC2 por región, límites de VPC y límites de ejecuciones simultáneas de Lambda. Si su carga de trabajo alcanza inesperadamente una cuota, las solicitudes se limitarán o rechazarán, lo que provocará fallos de fiabilidad. Utilice la consola de Service Quotas o la CLI para consultar los límites actuales y solicitar aumentos antes de necesitarlos. Supervise las métricas de uso para detectar cuándo se aproxima a los límites, antes de que afecten a la disponibilidad.

# List service quotas for EC2
aws service-quotas list-service-quotas \
  --service-code ec2 \
  --query 'Quotas[?QuotaName==`Running On-Demand Standard (A, C, D, H, I, M, R, T, Z) instances`]'

# Request quota increase
aws service-quotas request-service-quota-increase \
  --service-code ec2 \
  --quota-code L-1216C47A \
  --desired-value 500

Recuperación automática ante fallos

El pilar de Fiabilidad hace hincapié en la recuperación automática sin intervención humana. AWS proporciona varios mecanismos de autorreparación: EC2 Auto Recovery restaura automáticamente una instancia en el mismo hardware o la traslada a hardware en buen estado cuando falla las comprobaciones subyacentes. Las comprobaciones de estado de ASG terminan las instancias en mal estado y lanzan reemplazos. RDS Multi-AZ conmuta automáticamente a la instancia en espera. Diseñe su arquitectura de modo que la mayoría de los escenarios de fallo activen acciones de recuperación automática capturadas en las alarmas de CloudWatch.

# CloudWatch alarm to auto-recover a specific EC2 instance
aws cloudwatch put-metric-alarm \
  --alarm-name EC2-auto-recover \
  --metrics '[{"Id":"m1","MetricStat":{"Metric":{"Namespace":"AWS/EC2","MetricName":"StatusCheckFailed_System","Dimensions":[{"Name":"InstanceId","Value":"i-12345"}]},"Period":60,"Stat":"Maximum"}}]' \
  --comparison-operator GreaterThanThreshold \
  --threshold 0 \
  --evaluation-periods 2 \
  --alarm-actions 'arn:aws:automate:us-east-1:ec2:recover'

Escalado horizontal para la fiabilidad

El pilar de Fiabilidad recomienda escalar horizontalmente (añadir más instancias pequeñas) en lugar de verticalmente (escalar a instancias más grandes) para mejorar la fiabilidad. Una única instancia grande constituye un punto único de fallo. Muchas instancias pequeñas detrás de un balanceador de carga hacen que el impacto de cualquier fallo individual sea mínimo. AWS Auto Scaling ajusta automáticamente el tamaño de la flota para satisfacer la demanda, garantizando tanto que disponga de capacidad suficiente como que no pague por recursos inactivos durante los periodos de poca actividad.

# Horizontal scaling: 10 t3.medium vs 1 r5.4xlarge
# 10 t3.medium:
#   - Failure of 1 = loss of 10% capacity
#   - ASG launches replacement automatically
#   - 9 instances absorb load during replacement

# 1 r5.4xlarge:
#   - Failure = 100% downtime until instance recovered
#   - Much higher RTO (new instance launch: 1-3 min)

# Prefer horizontal scaling for stateless tiers

Pruebas de fiabilidad

El pilar de Fiabilidad exige probar los procedimientos de recuperación, no dar por hecho que funcionan. Utilice AWS Fault Injection Simulator (FIS) para inyectar fallos en su sistema de forma controlada: terminar instancias de EC2 aleatorias, limitar las llamadas a la API e inyectar latencia de red. Ejecute estos experimentos en producción (con medidas de protección) para validar que la supervisión detecta los fallos, el escalado automático responde y la recuperación se completa dentro de su RTO. Los procedimientos de recuperación que no se han probado suelen fallar bajo la presión de un incidente real.

# AWS FIS experiment: terminate random instance
aws fis create-experiment-template \
  --description 'Chaos: terminate 1 of 5 instances' \
  --targets '{"instanceTargets":{"resourceType":"aws:ec2:instance","selectionMode":"COUNT(1)","resourceTags":{"Env":"production"}}}' \
  --actions '{"terminateInstance":{"actionId":"aws:ec2:terminate-instances","targets":{"Instances":"instanceTargets"}}}' \
  --stop-conditions '[{"source":"aws:cloudwatch:alarm","value":"arn:aws:cloudwatch::123:alarm:high-error-rate"}]'

Descripción general del pilar de Eficiencia del rendimiento

El pilar de Eficiencia del rendimiento se centra en utilizar los recursos informáticos de forma eficiente para cumplir los requisitos del sistema y mantener dicha eficiencia a medida que cambian la demanda y las tecnologías. Principios de diseño clave: democratizar las tecnologías avanzadas: utilizar servicios administrados (RDS, SageMaker) en lugar de crearlos desde cero. Operar globalmente en minutos: realizar implementaciones en varias regiones con CloudFormation. Utilizar arquitecturas sin servidor: eliminar la gestión de la infraestructura. Experimentar con mayor frecuencia: probar distintos tipos de instancia y configuraciones.

# Performance Efficiency areas:
# Selection:   Right compute, storage, database, network
# Review:      Continuously evaluate new services
# Monitoring:  CloudWatch metrics guide decisions
# Trade-offs:  Consistency vs performance, latency vs cost

# Example: choosing between services
# RDS vs DynamoDB vs Aurora vs ElastiCache
# → depends on access patterns, consistency needs, scale

Selección del cómputo adecuado

La Eficiencia del rendimiento comienza por seleccionar el tipo de cómputo adecuado para su carga de trabajo. EC2 dispone de decenas de familias de instancias optimizadas para distintos casos de uso: c-series para cargas con uso intensivo de cómputo (codificación de vídeo y procesamiento por lotes), r-series para cargas con uso intensivo de memoria (bases de datos en memoria y almacenamiento en caché), i-series para cargas con uso intensivo de almacenamiento (NoSQL y almacenes de datos) y p/g-series para cargas de trabajo con GPU (entrenamiento de ML). Utilizar un tipo de instancia incorrecto implica pagar por una capacidad que no puede utilizar o degradar el rendimiento.

# AWS Compute Optimizer: get right-size recommendations
aws compute-optimizer get-ec2-instance-recommendations \
  --instance-arns arn:aws:ec2:us-east-1:123:instance/i-12345

# Output shows:
# - Current instance utilisation (CPU, memory, network)
# - Recommended instance type
# - Estimated monthly savings
# - Performance risk of changing

# Lambda: match memory to actual usage
# Use Lambda Power Tuning tool for memory optimisation

Almacenamiento en caché para la eficiencia del rendimiento

El almacenamiento en caché es una técnica fundamental de eficiencia del rendimiento que reduce la latencia y la carga de la base de datos. ElastiCache (Redis/Memcached) almacena en memoria los resultados de las consultas a la base de datos para acceder a ellos en milisegundos. CloudFront almacena respuestas HTTP en caché en ubicaciones periféricas cercanas a los usuarios. El almacenamiento en caché de API Gateway reduce las invocaciones de Lambda al almacenar las respuestas de la API en caché. DAX (DynamoDB Accelerator) añade una caché en memoria de microsegundos delante de DynamoDB. Elija la capa de caché adecuada según la ubicación del cuello de botella: base de datos, API o distribución periférica.

# DAX cluster for DynamoDB microsecond latency
aws dax create-cluster \
  --cluster-name my-dax \
  --node-type dax.r6g.large \
  --replication-factor 3 \
  --iam-role-arn arn:aws:iam::123:role/DAXRole \
  --subnet-group my-dax-subnet-group

# Application connects to DAX endpoint
# Cache hits: microseconds
# Cache misses: fetches from DynamoDB and caches result

Almacenamiento adecuado para el rendimiento

La elección del almacenamiento afecta considerablemente al rendimiento. io2 Block Express EBS proporciona hasta 256 000 IOPS para bases de datos de alto rendimiento. gp3 es la opción predeterminada para la mayoría de las cargas de trabajo y tiene un coste menor. Instance store proporciona el mayor número de IOPS (NVMe) para datos temporales. S3 escala hasta miles de solicitudes por segundo para el almacenamiento de objetos. EFS proporciona acceso compartido a archivos POSIX. Adapte el almacenamiento al patrón de E/S: las lecturas secuenciales se benefician de st1 (Throughput Optimised HDD), mientras que la E/S aleatoria requiere volúmenes SSD.

# EBS volume performance characteristics:
# gp3: 3,000-16,000 IOPS, 125-1,000 MB/s
# io2: 100-64,000 IOPS (up to 256k with Block Express)
# st1: 40-500 MB/s sequential throughput (HDD)
# sc1: 12-250 MB/s (cheapest, cold workloads)

# Create high-performance io2 volume
aws ec2 create-volume \
  --availability-zone us-east-1a \
  --volume-type io2 \
  --size 500 \
  --iops 50000

Supervisión del rendimiento y mejora continua

La Eficiencia del rendimiento no es una decisión que se tome una sola vez: debe supervisar continuamente las métricas de rendimiento y reevaluar sus decisiones a medida que AWS lanza nuevos servicios. Utilice paneles de CloudWatch para realizar un seguimiento de los percentiles de latencia p50, p90 y p99 (no solo de los promedios, que ocultan la latencia de cola). Utilice trazas de X-Ray para identificar las partes más lentas de una cadena de solicitudes. Configure la detección de anomalías de CloudWatch para establecer automáticamente una línea base y alertar sobre desviaciones anómalas del rendimiento. Revise periódicamente los anuncios de AWS: los tipos de instancia más recientes suelen proporcionar un mejor rendimiento a un coste menor.

# CloudWatch: track API response latency percentiles
aws cloudwatch put-metric-alarm \
  --alarm-name 'API-P99-Latency' \
  --metric-name TargetResponseTime \
  --namespace AWS/ApplicationELB \
  --extended-statistic p99 \
  --dimensions Name=LoadBalancer,Value=app/my-alb/xxx \
  --period 60 \
  --evaluation-periods 5 \
  --threshold 2.0 \
  --comparison-operator GreaterThanThreshold

Compensaciones en la eficiencia del rendimiento

En ocasiones, la Eficiencia del rendimiento requiere hacer concesiones con otros pilares. Añadir una caché (ElastiCache) mejora el rendimiento, pero aumenta la complejidad operativa (concesión con la Excelencia operativa) y el coste (concesión con la Optimización de costes). Utilizar DynamoDB en lugar de RDS mejora el rendimiento a escala, pero requiere rediseñar el modelo de datos (esfuerzo de Excelencia operativa). El Well-Architected Framework reconoce estas concesiones y le pide que las realice de forma consciente, documentando los motivos. En las preguntas del examen, busque la opción que logre los objetivos de rendimiento con la menor sobrecarga operativa.

# Common performance vs cost trade-offs:
# Cache:         +Performance, +Cost, +Complexity
# Read Replicas: +Read performance, +Cost
# SSD vs HDD:    +IOPS, +Cost
# Multi-region:  -Latency for users, +Cost, +Complexity

# Common performance vs consistency trade-offs:
# DynamoDB eventually consistent reads: +Throughput, -Consistency
# Aurora Reader endpoint: +Read scale, potential replication lag

Comprobación rápida

Compruebe sus conocimientos sobre los conceptos de AWS Solutions Architect (SAA-C03) de esta lección.

Resumen de la lección

En esta lección ha aprendido que la Fiabilidad requiere recuperación automática, escalado horizontal y pruebas periódicas de fallos; la Eficiencia del rendimiento requiere seleccionar el cómputo, el almacenamiento y el tipo de base de datos adecuados para cada carga de trabajo; y el almacenamiento en caché en varias capas reduce la latencia y la carga de la base de datos. Ambos pilares requieren una supervisión continua y la disposición a revisar las decisiones arquitectónicas. A continuación, exploraremos los pilares de Optimización de costes y Sostenibilidad.

Preguntas frecuentes

¿La lección «Pilares de fiabilidad y eficiencia del rendimiento» es gratis?

Sí — el texto completo de «Pilares de fiabilidad y eficiencia del rendimiento» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Cloud & IT Cert Prep, actualiza a CoddyKit PRO. El curso de Cloud & IT Cert Prep incluye 4 lecciones en total.

¿Qué aprenderé en «Pilares de fiabilidad y eficiencia del rendimiento»?

Diseñe para la recuperación automática, el escalado horizontal y la gestión de capacidad; elija los tipos de recursos adecuados y supervise el sistema para mantener el rendimiento a lo largo del tiem… Practicas Cloud & IT Cert Prep con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Cloud & IT Cert Prep?

No se requiere experiencia previa. Cloud & IT Cert Prep en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Pilares de fiabilidad y eficiencia del rendimiento»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Cloud & IT Cert Prep?

Sí. Cada lección de Cloud & IT Cert Prep incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Pilares de excelencia operativa y seguridad
  2. Pilares de fiabilidad y eficiencia del rendimiento
  3. Pilares de optimización de costes y sostenibilidad
  4. AWS Well-Architected Tool y proceso de revisión
← Volver a Cloud & IT Cert Prep