Estatística descritiva e distribuições
Média, mediana, variância, desvio padrão, assimetria, curtose e distribuições normal, binomial e de Poisson.
Estatística descritiva e distribuições é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 4 aulas no total.
Resumindo dados
Estatísticas descritivas condensam um conjunto de dados em alguns números que descrevem seu centro, sua dispersão e sua forma. Elas são a primeira coisa que você calcula em qualquer conjunto de dados novo.
import numpy as np
data = np.array([4, 8, 6, 5, 3, 7, 9, 6])Média e mediana
A mean é a média aritmética; a median é o valor central. A median é resistente a valores discrepantes, portanto uma grande diferença entre as duas indica assimetria.
print(np.mean(data)) # 6.0
print(np.median(data)) # 6.0Variância e desvio padrão
Variância é o desvio quadrático médio em relação à mean; desvio padrão é sua raiz quadrada, na mesma unidade dos dados.
print(np.var(data)) # population variance
print(np.std(data)) # standard deviationAmostra versus população (ddof)
NumPy divide por N por padrão (população). Para uma estimativa de SAMPLE, divida por N-1 usando ddof=1, o que corrige o viés.
print(np.std(data, ddof=0)) # population
print(np.std(data, ddof=1)) # sample (unbiased)Percentis e IQR
Os percentis dividem os dados ordenados. Os percentis 25 e 75 (quartis) delimitam os 50 por cento centrais; a diferença entre eles é o IQR.
q1 = np.percentile(data, 25)
q3 = np.percentile(data, 75)
print(q1, q3, q3 - q1) # IQRAssimetria
Assimetria mede a falta de simetria. A assimetria positiva tem uma cauda direita longa (dados de renda); a assimetria negativa tem uma cauda esquerda longa. scipy.stats.skew faz esse cálculo.
from scipy import stats
print(stats.skew(data)) # near 0 -> symmetricCurtose
Curtose mede o peso das caudas. Uma curtose alta significa que há mais valores discrepantes extremos do que em uma curva normal. scipy informa a curtose excedente (normal = 0).
print(stats.kurtosis(data)) # 0 means normal-like tailsA distribuição normal
A distribuição normal, em forma de sino, é definida pela mean e pelo desvio padrão. Cerca de 68 por cento dos valores ficam a até um std da média, e 95 por cento, a até dois.
sample = stats.norm.rvs(loc=0, scale=1, size=1000, random_state=0)
print(np.mean(sample), np.std(sample)) # near 0 and 1A distribuição binomial
A distribuição binomial conta os sucessos em n tentativas independentes de sim ou não, com probabilidade de sucesso p, como obter cara em lançamentos de uma moeda.
print(stats.binom.pmf(k=3, n=10, p=0.5)) # P(exactly 3 heads in 10)A distribuição de Poisson
A distribuição de Poisson modela a contagem de eventos raros em um intervalo fixo, dada uma taxa média lambda, como chegadas por minuto.
print(stats.poisson.pmf(k=2, mu=3)) # P(2 events when avg is 3)Histogramas
Um histograma agrupa valores em intervalos para revelar a forma de uma distribuição. np.histogram retorna as contagens e os limites dos intervalos; matplotlib o desenha.
counts, edges = np.histogram(sample, bins=10)
print(counts)
# import matplotlib.pyplot as plt; plt.hist(sample, bins=30)Verificação rápida
Teste seus conhecimentos sobre estatística descritiva.
Recapitulação
Kit de ferramentas de estatística descritiva:
- Centro:
np.mean,np.median - Dispersão:
np.var,np.std(useddof=1para amostras), IQR por meio de percentis - Forma:
scipy.stats.skew,scipy.stats.kurtosis - Distribuições: normal, binomial e Poisson em
scipy.stats - Histogramas para visualizar a forma
Perguntas Frequentes
A aula “Estatística descritiva e distribuições” é grátis?
Sim — o texto completo de “Estatística descritiva e distribuições” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 4 aulas no total.
O que vou aprender em “Estatística descritiva e distribuições”?
Média, mediana, variância, desvio padrão, assimetria, curtose e distribuições normal, binomial e de Poisson. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Learn AI with Python?
Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Estatística descritiva e distribuições”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Learn AI with Python?
Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Estatística descritiva e distribuições
- Probabilidade e teorema de Bayes
- Testes de hipóteses
- Correlação e covariância