Fusión, combinación y limpieza de datos
Combine DataFrames y gestione valores ausentes de forma profesional.
Fusión, combinación y limpieza de datos es una lección gratuita de Python Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Python Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Python Academy incluye 4 lecciones en total.
pd.merge
pd.merge(left, right, on="key") une dos DataFrames mediante una columna común, de forma similar a SQL JOIN.
import pandas as pd
users = pd.DataFrame({"id":[1,2,3],"name":["A","B","C"]})
orders = pd.DataFrame({"user_id":[1,1,2],"amount":[100,50,200]})
result = pd.merge(users, orders, left_on="id", right_on="user_id")
print(result)Tipos de unión
Especifique how="inner" (predeterminado), "left", "right" u "outer" para controlar qué filas se conservan.
import pandas as pd
A = pd.DataFrame({"key":["a","b","c"],"val":[1,2,3]})
B = pd.DataFrame({"key":["b","c","d"],"x":[10,20,30]})
print(pd.merge(A, B, on="key", how="left")) # all of A
print(pd.merge(A, B, on="key", how="outer")) # all rowsdf.join
df.join(other) realiza la unión mediante el índice. Es más rápido y sencillo cuando se unen índices en lugar de columnas.
import pandas as pd
df1 = pd.DataFrame({"a":[1,2]}, index=["x","y"])
df2 = pd.DataFrame({"b":[3,4]}, index=["x","y"])
print(df1.join(df2))
# x: a=1 b=3
# y: a=2 b=4concat
pd.concat([df1, df2]) apila DataFrames verticalmente (axis=0) u horizontalmente (axis=1).
import pandas as pd
df1 = pd.DataFrame({"a":[1,2]})
df2 = pd.DataFrame({"a":[3,4]})
print(pd.concat([df1,df2], ignore_index=True))
# a: 1 2 3 4
# Horizontal:
df3 = pd.DataFrame({"b":[5,6]})
print(pd.concat([df1,df3], axis=1))Gestión de valores faltantes
Detecte NaN con isna()/notna(). Rellene los valores con fillna(). Elimínelos con dropna().
import pandas as pd, numpy as np
df = pd.DataFrame({"a":[1,np.nan,3],"b":[np.nan,2,3]})
print(df.isna().sum()) # count nulls per column
df["a"] = df["a"].fillna(0)
df = df.dropna() # drop rows with any nullEstrategias de fillna
Rellene los valores faltantes con una constante, propagando el último valor (ffill), propagando el siguiente valor (bfill) o utilizando la media de la columna.
import pandas as pd, numpy as np
df = pd.DataFrame({"val":[1, np.nan, np.nan, 4]})
print(df["val"].ffill()) # forward fill: 1 1 1 4
print(df["val"].bfill()) # back fill: 1 4 4 4
print(df["val"].fillna(df["val"].mean())) # fill with meanCambio de tipos de datos
Use astype() para convertir los tipos de las columnas. Use pd.to_datetime() para analizar fechas y pd.to_numeric con errors="coerce" para realizar una conversión numérica segura.
import pandas as pd
df = pd.DataFrame({"age":["25","30","35"],"date":["2024-01-01","2024-06-15","2024-12-31"]})
df["age"] = df["age"].astype(int)
df["date"] = pd.to_datetime(df["date"])
print(df.dtypes)Limpieza de cadenas
El accesor .str de Pandas proporciona operaciones vectorizadas para cadenas: strip(), lower(), replace() y extract().
import pandas as pd
df = pd.DataFrame({"name":[" Alice "," bob","CAROL"]})
df["clean"] = df["name"].str.strip().str.title()
print(df["clean"]) # Alice / Bob / CarolCambio de nombre y reordenación de columnas
Cambie los nombres con df.rename(columns={"old":"new"}). Reordene las columnas indexando con una lista.
import pandas as pd
df = pd.DataFrame({"a":[1],"b":[2],"c":[3]})
df = df.rename(columns={"a":"alpha","b":"beta"})
df = df[["c","beta","alpha"]] # reorder
print(df.columns.tolist()) # ['c', 'beta', 'alpha']Detección de duplicados
Busque duplicados con duplicated() y elimínelos con drop_duplicates().
import pandas as pd
df = pd.DataFrame({"id":[1,2,1,3],"val":["a","b","a","c"]})
print(df.duplicated()) # [F F T F]
print(df[df.duplicated()]) # show duplicates
clean = df.drop_duplicates(subset=["id"])apply para transformar filas y columnas
df.apply(func, axis=1) aplica una función a cada fila. axis=0 la aplica a cada columna.
import pandas as pd
df = pd.DataFrame({"a":[1,2,3],"b":[4,5,6]})
# New column = row sum:
df["total"] = df.apply(lambda row: row["a"] + row["b"], axis=1)
print(df)Comprobación rápida
¿Qué hace df.fillna(method="ffill")?
Resumen
Use pd.merge para realizar uniones al estilo de SQL y pd.concat para apilar datos. Gestione NaN con isna(), fillna() y dropna(). Limpie las cadenas con el accesor .str. Convierta los tipos con astype() y pd.to_datetime().
Preguntas frecuentes
¿La lección «Fusión, combinación y limpieza de datos» es gratis?
Sí — el texto completo de «Fusión, combinación y limpieza de datos» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Python Academy, actualiza a CoddyKit PRO. El curso de Python Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Fusión, combinación y limpieza de datos»?
Combine DataFrames y gestione valores ausentes de forma profesional. Practicas Python Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Python Academy?
No se requiere experiencia previa. Python Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Fusión, combinación y limpieza de datos»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Python Academy?
Sí. Cada lección de Python Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Fundamentos de Series y DataFrame
- Indexación, filtrado y máscaras booleanas
- GroupBy, agregación y tablas dinámicas
- Fusión, combinación y limpieza de datos