Unione, join e pulizia dei dati
Combini DataFrame e gestisca i valori mancanti in modo professionale.
Unione, join e pulizia dei dati è una lezione Python Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Python Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Python Academy include 4 lezioni in totale.
pd.merge
pd.merge(left, right, on="key") unisce due DataFrame in base a una colonna comune — in modo simile a una JOIN SQL.
import pandas as pd
users = pd.DataFrame({"id":[1,2,3],"name":["A","B","C"]})
orders = pd.DataFrame({"user_id":[1,1,2],"amount":[100,50,200]})
result = pd.merge(users, orders, left_on="id", right_on="user_id")
print(result)Tipi di join
Specifichi how="inner" (predefinito), "left", "right" oppure "outer" per controllare quali righe mantenere.
import pandas as pd
A = pd.DataFrame({"key":["a","b","c"],"val":[1,2,3]})
B = pd.DataFrame({"key":["b","c","d"],"x":[10,20,30]})
print(pd.merge(A, B, on="key", how="left")) # all of A
print(pd.merge(A, B, on="key", how="outer")) # all rowsdf.join
df.join(other) esegue l'unione in base all'indice. È più rapido e semplice quando si uniscono i dati tramite l'indice anziché tramite una colonna.
import pandas as pd
df1 = pd.DataFrame({"a":[1,2]}, index=["x","y"])
df2 = pd.DataFrame({"b":[3,4]}, index=["x","y"])
print(df1.join(df2))
# x: a=1 b=3
# y: a=2 b=4concat
pd.concat([df1, df2]) impila i DataFrame verticalmente (axis=0) o orizzontalmente (axis=1).
import pandas as pd
df1 = pd.DataFrame({"a":[1,2]})
df2 = pd.DataFrame({"a":[3,4]})
print(pd.concat([df1,df2], ignore_index=True))
# a: 1 2 3 4
# Horizontal:
df3 = pd.DataFrame({"b":[5,6]})
print(pd.concat([df1,df3], axis=1))Gestione dei valori mancanti
Rilevi NaN con isna()/notna(). Riempia i valori con fillna(). Li elimini con dropna().
import pandas as pd, numpy as np
df = pd.DataFrame({"a":[1,np.nan,3],"b":[np.nan,2,3]})
print(df.isna().sum()) # count nulls per column
df["a"] = df["a"].fillna(0)
df = df.dropna() # drop rows with any nullStrategie per fillna
Riempia i valori mancanti con una costante, con il riempimento in avanti (ffill), con il riempimento all'indietro (bfill) oppure con la media della colonna.
import pandas as pd, numpy as np
df = pd.DataFrame({"val":[1, np.nan, np.nan, 4]})
print(df["val"].ffill()) # forward fill: 1 1 1 4
print(df["val"].bfill()) # back fill: 1 4 4 4
print(df["val"].fillna(df["val"].mean())) # fill with meanModifica dei tipi di dati
Utilizzi astype() per convertire i tipi delle colonne. Utilizzi pd.to_datetime() per analizzare le date e pd.to_numeric con errors="coerce" per una conversione numerica sicura.
import pandas as pd
df = pd.DataFrame({"age":["25","30","35"],"date":["2024-01-01","2024-06-15","2024-12-31"]})
df["age"] = df["age"].astype(int)
df["date"] = pd.to_datetime(df["date"])
print(df.dtypes)Pulizia delle stringhe
L'accessor .str di Pandas fornisce operazioni vettorializzate sulle stringhe: strip(), lower(), replace(), extract().
import pandas as pd
df = pd.DataFrame({"name":[" Alice "," bob","CAROL"]})
df["clean"] = df["name"].str.strip().str.title()
print(df["clean"]) # Alice / Bob / CarolRinomina e riordinamento delle colonne
Rinomini con df.rename(columns={"old":"new"}). Riordini le colonne indicizzando con un elenco.
import pandas as pd
df = pd.DataFrame({"a":[1],"b":[2],"c":[3]})
df = df.rename(columns={"a":"alpha","b":"beta"})
df = df[["c","beta","alpha"]] # reorder
print(df.columns.tolist()) # ['c', 'beta', 'alpha']Rilevamento dei duplicati
Trovi i duplicati con duplicated() e li rimuova con drop_duplicates().
import pandas as pd
df = pd.DataFrame({"id":[1,2,1,3],"val":["a","b","a","c"]})
print(df.duplicated()) # [F F T F]
print(df[df.duplicated()]) # show duplicates
clean = df.drop_duplicates(subset=["id"])apply per trasformare righe e colonne
df.apply(func, axis=1) applica una funzione a ogni riga. axis=0 la applica a ogni colonna.
import pandas as pd
df = pd.DataFrame({"a":[1,2,3],"b":[4,5,6]})
# New column = row sum:
df["total"] = df.apply(lambda row: row["a"] + row["b"], axis=1)
print(df)Verifica rapida
Che cosa fa df.fillna(method="ffill")?
Riepilogo
Utilizzi pd.merge per join in stile SQL e pd.concat per impilare i dati. Gestisca NaN con isna(), fillna() e dropna(). Pulisca le stringhe con l'accessor .str. Converta i tipi con astype() e pd.to_datetime().
Domande Frequenti
La lezione «Unione, join e pulizia dei dati» è gratuita?
Sì — il testo completo di «Unione, join e pulizia dei dati» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Python Academy, passa a CoddyKit PRO. Il corso Python Academy include 4 lezioni in totale.
Cosa imparerò in «Unione, join e pulizia dei dati»?
Combini DataFrame e gestisca i valori mancanti in modo professionale. Eserciti Python Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare Python Academy?
Non è richiesta alcuna esperienza precedente. Python Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.
Quanto tempo richiede la lezione «Unione, join e pulizia dei dati»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione Python Academy?
Sì. Ogni lezione Python Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Fondamenti di Series e DataFrame
- Indicizzazione, filtraggio e maschere booleane
- GroupBy, aggregazione e tabelle pivot
- Unione, join e pulizia dei dati