0Pricing
Learn AI with Python · Lektion

Korrelation und Kovarianz

Pearson- und Spearman-Korrelation, Kovarianzmatrix und Interpretation von Korrelation im ML-Kontext.

Korrelation und Kovarianz ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Beziehungen messen

Kovarianz und Korrelation quantifizieren, wie sich zwei Variablen gemeinsam verändern. Sie bilden die Grundlage für Feature-Auswahl, Portfoliotheorie und explorative Analysen.

Kovarianz

Kovarianz ist positiv, wenn Variablen gemeinsam steigen, und negativ, wenn eine steigt, während die andere fällt. Ihre Größe hängt von den Einheiten ab, wodurch eine unverarbeitete Kovarianz schwer zu interpretieren ist.

import numpy as np
x = np.array([1, 2, 3, 4, 5])
y = np.array([2, 4, 5, 4, 6])
print(np.cov(x, y, ddof=1))   # 2x2 covariance matrix

Die Kovarianzmatrix

np.cov gibt eine Matrix zurück: Auf der Diagonalen stehen die Varianzen, außerhalb der Diagonalen die Kovarianzen zwischen den Variablenpaaren. Das Konzept lässt sich auf viele Variablen erweitern und bildet die Grundlage der PCA.

data = np.array([[1, 2, 3], [2, 4, 5], [3, 6, 7]], dtype=float)
print(np.cov(data.T))   # 3x3 covariance matrix of the columns

Korrelation: skalierte Kovarianz

Die Pearson-Korrelation skaliert die Kovarianz auf den Bereich von -1 bis 1, indem sie durch das Produkt der Standardabweichungen teilt. Dadurch ist sie einheitenfrei und vergleichbar.

print(np.corrcoef(x, y))   # 2x2 correlation matrix, diagonal is 1

Korrelation interpretieren

+1 steht für eine perfekte positive lineare Beziehung, -1 für eine perfekte negative und 0 für keine LINEARE Beziehung. Werte nahe 0 können dennoch ein starkes nichtlineares Muster verbergen.

Korrelation in pandas

df.corr() berechnet paarweise Korrelationen für alle numerischen Spalten auf einmal – die schnellste Möglichkeit, einen Datensatz auf Beziehungen zu überprüfen.

import pandas as pd
df = pd.DataFrame({"a": [1,2,3,4,5], "b": [2,4,5,4,6], "c": [9,7,6,5,3]})
print(df.corr())   # Pearson by default

Pearson vs. Spearman

Pearson misst den LINEAREN Zusammenhang anhand der Rohwerte. Spearman arbeitet mit RÄNGEN und erfasst daher jede monotone Beziehung; außerdem ist er unempfindlicher gegenüber Ausreißern.

from scipy import stats
x = np.array([1, 2, 3, 4, 100])
y = np.array([1, 2, 3, 4, 5])
print(stats.pearsonr(x, y).statistic)    # distorted by outlier
print(stats.spearmanr(x, y).statistic)   # 1.0 (perfectly monotonic)

Die Methode auswählen

df.corr(method="spearman") stellt pandas auf Rangkorrelation um. Verwenden Sie Spearman bei Ausreißern oder nichtlinearen, aber monotonen Beziehungen; Pearson eignet sich für saubere lineare Daten.

print(df.corr(method="spearman"))

Korrelation ist NICHT Kausalität

Eine starke Korrelation bedeutet nicht, dass eine Variable die andere verursacht. Ein verborgener Confounder kann beide beeinflussen. Fragen Sie sich immer, was den Zusammenhang sonst noch erklären könnte.

Scheinkorrelation

Bei genügend vielen Variablen werden einige rein zufällig korrelieren. Der Verkauf von Speiseeis und die Zahl der Ertrinkungsunfälle korrelieren, weil beide durch die sommerliche Hitze beeinflusst werden, nicht gegenseitig. Betrachten Sie unerwartete Korrelationen mit Skepsis.

Visualisierung mit einer Heatmap

Eine Korrelations-Heatmap macht Muster deutlich sichtbar. Stark korrelierte Merkmalspaare können redundant sein und Kandidaten für eine Entfernung vor der Modellierung darstellen.

# import seaborn as sns
# sns.heatmap(df.corr(), annot=True, cmap="coolwarm")

Kurze Überprüfung

Testen Sie Ihr Wissen über Korrelationen.

Zusammenfassung

Werkzeuge für Korrelationen:

  • Die Kovarianz zeigt die Richtung, hängt aber von den Einheiten ab; np.cov liefert die Matrix
  • Die Korrelation skaliert auf -1..1: np.corrcoef, df.corr()
  • Pearson (linear) vs. Spearman (Rang, robust, monoton)
  • Korrelation ist nicht Kausalität; achten Sie auf Confounder und Scheinkorrelationen

Häufig gestellte Fragen

Ist die Lektion „Korrelation und Kovarianz“ kostenlos?

Ja — der vollständige Text von „Korrelation und Kovarianz“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Korrelation und Kovarianz“?

Pearson- und Spearman-Korrelation, Kovarianzmatrix und Interpretation von Korrelation im ML-Kontext. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Korrelation und Kovarianz“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Deskriptive Statistik und Verteilungen
  2. Wahrscheinlichkeit und der Satz von Bayes
  3. Hypothesentests
  4. Korrelation und Kovarianz
← Zurück zu Learn AI with Python