0Pricing
AWS Security Academy · Lección

Particionado de registros para mejorar velocidad y costes

Organice los datos para que las investigaciones sean más rápidas y económicas

Particionado de registros para mejorar velocidad y costes es una lección gratuita de AWS Security Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AWS Security Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AWS Security Academy incluye 4 lecciones en total.

El coste del análisis

Como Athena cobra por los datos analizados, consultar un año de registros para encontrar los eventos de un solo día desperdicia tiempo y dinero. La partición es la técnica que permite a Athena leer únicamente el segmento de datos relevante, lo que hace que las consultas sean mucho más rápidas y económicas. Es la optimización más importante de Athena.

Qué es una partición

Una partición divide los datos de una tabla según los valores de una o más columnas, normalmente componentes de fecha, asignados a prefijos de S3. Los registros de CloudTrail ya están organizados por region/year/month/day, por lo que particionar según estos elementos coincide con la estructura física y permite que Athena omita las carpetas que quedan fuera de la consulta.

Poda de particiones

Cuando una consulta filtra por una columna de partición, Athena realiza la poda de particiones: lee únicamente los prefijos coincidentes e ignora el resto. Una consulta de un solo día con particiones adecuadas analiza una fracción mínima del bucket. Sin poda, la misma consulta analizaría todo, incluso datos que no puede necesitar.

Añadir particiones manualmente

Una forma de registrar particiones es ALTER TABLE ADD PARTITION, que asigna un valor de partición a su ubicación en S3. Este método funciona, pero resulta tedioso para los datos de registro diarios, ya que tendría que añadir una partición cada día. Es adecuado para cargas históricas puntuales, pero no escala con registros continuos.

Proyección de particiones

La proyección de particiones es el enfoque moderno recomendado: se indica a Athena el patrón de partición, como un intervalo de fechas, y Athena calcula los prefijos en el momento de la consulta sin almacenar cada partición en el catálogo. Para datos de CloudTrail y Flow Logs que crecen continuamente, esto evita el mantenimiento constante y mantiene automática la poda.

TBLPROPERTIES (
  'projection.enabled'='true',
  'projection.dt.type'='date',
  'projection.dt.range'='2023/01/01,NOW',
  'projection.dt.format'='yyyy/MM/dd'
)

Glue Crawlers para las particiones

Un Glue crawler también puede detectar nuevas particiones según una programación y añadirlas al catálogo. Esto automatiza la gestión de particiones para datos cambiantes, aunque, en estructuras predecibles basadas en fechas, la proyección de particiones suele ser más sencilla y no genera costes de crawler.

Los formatos columnares multiplican el ahorro

La partición limita los archivos que se leen; los formatos columnares, como Parquet, limitan las columnas que se leen dentro de esos archivos. Combinar ambos enfoques —convertir los registros a Parquet y particionarlos por fecha— puede reducir los datos analizados en varios órdenes de magnitud. Muchos equipos ejecutan un trabajo de conversión para almacenar copias optimizadas para consultas de los registros de gran volumen.

Compresión

Comprimir los datos de registro con formatos como GZIP o Snappy reduce aún más los bytes analizados y el coste de almacenamiento. Athena lee los archivos comprimidos de forma transparente. Junto con la partición y el almacenamiento columnar, la compresión completa el trío de técnicas que hace asequible el análisis de registros a gran escala.

Diseñar particiones para la seguridad

En los registros de seguridad, particione principalmente por fecha, ya que las investigaciones están limitadas en el tiempo, y considere particionar por cuenta o región en los organization trails para poder dirigirse rápidamente a una cuenta. Las claves de partición adecuadas reflejan cómo filtra realmente sus investigaciones y maximizan la poda en las consultas reales.

Supervisar las métricas de análisis

Athena informa de los datos analizados en cada consulta. Supervisar esta métrica le indica si la partición funciona: una consulta correctamente particionada y limitada por tiempo debería analizar megabytes, no terabytes. Si una consulta analiza mucho más de lo previsto, probablemente el filtro no está alineado con las columnas de partición.

Integrar la optimización

La estrategia de optimización consiste en usar la partición para omitir datos irrelevantes, un formato columnar para leer únicamente las columnas necesarias y la compresión para reducir los bytes. Aplicadas a CloudTrail y Flow Logs, estas técnicas convierten análisis que serían lentos y costosos en investigaciones rápidas y económicas, justo lo que requiere el análisis de seguridad a gran escala.

Comprobación rápida

Compruebe sus conocimientos sobre la partición.

Resumen

La partición divide los datos de la tabla según columnas (normalmente la fecha), de modo que Athena realiza la poda de particiones y analiza únicamente los prefijos relevantes, reduciendo el coste y el tiempo. Prefiera la proyección de particiones frente a ADD PARTITION manual o a los crawlers para los registros que crecen continuamente. Combine las particiones con Parquet columnar y compresión para obtener un gran ahorro, particione los registros de seguridad por fecha y cuenta, y supervise la métrica de datos analizados.

Preguntas frecuentes

¿La lección «Particionado de registros para mejorar velocidad y costes» es gratis?

Sí — el texto completo de «Particionado de registros para mejorar velocidad y costes» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AWS Security Academy, actualiza a CoddyKit PRO. El curso de AWS Security Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Particionado de registros para mejorar velocidad y costes»?

Organice los datos para que las investigaciones sean más rápidas y económicas Practicas AWS Security Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AWS Security Academy?

No se requiere experiencia previa. AWS Security Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Particionado de registros para mejorar velocidad y costes»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AWS Security Academy?

Sí. Cada lección de AWS Security Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Consulta de registros de S3 con Athena
  2. Creación de tablas sobre datos de CloudTrail
  3. Investigación de incidentes con consultas SQL
  4. Particionado de registros para mejorar velocidad y costes
← Volver a AWS Security Academy