Pulizia e preprocessing dei dati
Comprenda come gestire i dati mancanti, rimuovere i duplicati e preparare i dati grezzi per l'analisi
Pulizia e preprocessing dei dati è una lezione Python For Kids gratuita su CoddyKit. Questa è la lezione 4 di 5. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Python For Kids, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Python For Kids include 5 lezioni in totale.
Panoramica sulla pulizia dei dati
Pulizia e preprocessing dei dati
I dati grezzi sono spesso disordinati e richiedono pulizia e preprocessing prima di poter essere analizzati. Questi passaggi sono fondamentali per garantire la qualità e l'accuratezza dell'analisi.
In questa lezione imparerà tecniche per gestire i dati mancanti, rimuovere i duplicati e preparare i dati per l'analisi.

Che cos’è la pulizia dei dati?
La pulizia dei dati consiste nell’identificare e correggere gli errori presenti nel dataset. Le attività più comuni includono:
- Gestire i valori mancanti.
- Rimuovere i duplicati.
- Standardizzare i formati.
Gestione dei dati mancanti
I dati mancanti possono verificarsi per diversi motivi. È possibile gestirli nei seguenti modi:
- Riempire i valori mancanti con un valore predefinito oppure con la media o la mediana.
- Eliminare le righe o le colonne che contengono troppi valori mancanti.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Rimozione dei duplicati
I dati duplicati possono distorcere l'analisi. Utilizzi Pandas per rimuovere i duplicati:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Standardizzazione dei dati
La standardizzazione dei dati garantisce la coerenza. Ad esempio, è possibile uniformare i formati delle date o la distinzione tra maiuscole e minuscole nel testo:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Trasformazione dei dati
Le trasformazioni, come il ridimensionamento e la codifica, fanno parte del preprocessing:
- Ridimensionamento: standardizzazione dei valori numerici.
- Codifica: conversione dei dati categorici in forma numerica.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Ridimensionamento dei dati
Il ridimensionamento garantisce che i dati numerici siano sulla stessa scala, un requisito essenziale per gli algoritmi di machine learning:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Convalida dei dati
La convalida garantisce che i dati soddisfino gli standard di qualità. Ad esempio, è possibile verificare la presenza di outlier o di valori non validi:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Errori comuni nella pulizia dei dati
Ecco alcuni errori da evitare:
- Ignorare i dati mancanti, causando analisi imprecise.
- Non uniformare i formati, causando incoerenze.
- Trascurare la convalida, causando errori nelle attività successive.
Che cosa abbiamo imparato?
In questa lezione ha imparato:
- Come gestire i dati mancanti e rimuovere i duplicati.
- Come standardizzare, trasformare e ridimensionare i dati per l'analisi.
- Come convalidare la qualità dei dati e identificare gli outlier.
- L'importanza della pulizia dei dati per ottenere analisi accurate.
Ottimo lavoro! Passiamo al prossimo argomento.

Domande Frequenti
La lezione «Pulizia e preprocessing dei dati» è gratuita?
Sì — il testo completo di «Pulizia e preprocessing dei dati» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Python For Kids, passa a CoddyKit PRO. Il corso Python For Kids include 5 lezioni in totale.
Cosa imparerò in «Pulizia e preprocessing dei dati»?
Comprenda come gestire i dati mancanti, rimuovere i duplicati e preparare i dati grezzi per l'analisi Eserciti Python For Kids con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare Python For Kids?
Non è richiesta alcuna esperienza precedente. Python For Kids su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 5.
Quanto tempo richiede la lezione «Pulizia e preprocessing dei dati»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione Python For Kids?
Sì. Ogni lezione Python For Kids include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Che cos'è la data science?
- Il ruolo di Python nella data science
- Strutture dati per la data science
- Pulizia e preprocessing dei dati
- Analisi esplorativa dei dati (EDA)