Limpeza e pré-processamento de dados
Entenda como lidar com dados ausentes, remover duplicatas e pré-processar dados brutos para análise.
Limpeza e pré-processamento de dados é uma aula grátis de Python Academy no CoddyKit. Esta é a aula 4 de 5. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Python Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Python Academy inclui 5 aulas no total.
Visão geral da limpeza de dados
Limpeza e pré-processamento de dados
Os dados brutos costumam ser desorganizados e precisam ser limpos e pré-processados antes de poderem ser analisados. Essas etapas são fundamentais para garantir a qualidade e a precisão da sua análise.
Nesta lição, você aprenderá técnicas para lidar com dados ausentes, remover duplicatas e pré-processar dados para análise.

O que é limpeza de dados?
O que é limpeza de dados?
A limpeza de dados envolve identificar e corrigir erros no conjunto de dados. As tarefas comuns incluem:
- Lidar com valores ausentes.
- Remover duplicatas.
- Padronizar formatos.
Como lidar com dados ausentes
Como lidar com dados ausentes
Dados ausentes podem ocorrer por diversos motivos. Você pode lidar com eles:
- Preenchendo valores ausentes com um valor padrão ou com mean/mediana.
- Removendo linhas ou colunas com valores ausentes em excesso.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Removendo duplicatas
Removendo duplicatas
Dados duplicados podem distorcer sua análise. Use o Pandas para remover duplicatas:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Padronizando dados
Padronizando dados
A padronização dos dados garante consistência. Por exemplo, você pode padronizar formatos de data ou o uso de maiúsculas e minúsculas no texto:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Transformando dados
Transformando dados
Transformações como escalonamento e codificação fazem parte do pré-processamento:
- Escalonamento: Padronização de valores numéricos.
- Codificação: Conversão de dados categóricos para o formato numérico.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Escalonamento de dados
Escalonamento de dados
O escalonamento garante que os dados numéricos estejam na mesma escala, o que é essencial para os algoritmos de aprendizado de máquina:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Validação de dados
Validação de dados
A validação garante que os dados atendam aos padrões de qualidade. Por exemplo, verifique se há valores discrepantes ou inválidos:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Erros comuns na limpeza de dados
Erros comuns na limpeza de dados
Veja alguns erros que devem ser evitados:
- Ignorar dados ausentes, o que leva a uma análise imprecisa.
- Não padronizar formatos, causando inconsistências.
- Negligenciar a validação, o que leva a erros em tarefas posteriores.
O que aprendemos?
O que aprendemos?
Nesta lição, você aprendeu:
- Como lidar com dados ausentes e remover duplicatas.
- Como padronizar, transformar e escalonar dados para análise.
- Como validar a qualidade dos dados e identificar valores discrepantes.
- A importância da limpeza de dados para obter análises precisas.
Parabéns! Vamos passar para o próximo tópico.

Perguntas Frequentes
A aula “Limpeza e pré-processamento de dados” é grátis?
Sim — o texto completo de “Limpeza e pré-processamento de dados” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Python Academy, atualize para CoddyKit PRO. O curso de Python Academy inclui 5 aulas no total.
O que vou aprender em “Limpeza e pré-processamento de dados”?
Entenda como lidar com dados ausentes, remover duplicatas e pré-processar dados brutos para análise. Você pratica Python Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Python Academy?
Nenhuma experiência prévia é necessária. Python Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 5.
Quanto tempo leva a aula “Limpeza e pré-processamento de dados”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Python Academy?
Sim. Cada aula de Python Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- O que é ciência de dados?
- O papel do Python na ciência de dados
- Estruturas de dados para ciência de dados
- Limpeza e pré-processamento de dados
- Análise exploratória de dados (EDA)