0Pricing
Learn AI with Python · Lektion

Bivariate und multivariate Analyse

Streudiagramme, Pairplots, Korrelations-Heatmaps und gruppierte Statistiken.

Bivariate und multivariate Analyse ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Von einer Variable zu mehreren

Bivariate Analyse untersucht die Beziehung zwischen zwei Variablen; multivariate Analyse betrachtet mehrere Variablen gleichzeitig.

Das Ziel: herausfinden, welche Merkmale sich gemeinsam verändern, Wechselwirkungen erkennen und entscheiden, welche Variablen für Ihre Zielvariable prädiktiv sind.

Streudiagramme mit plt.scatter

Ein Streudiagramm stellt zwei numerische Variablen einander gegenüber – jeder Punkt entspricht einer Zeile. Es macht Trends, Cluster und Ausreißer sichtbar.

import matplotlib.pyplot as plt
import seaborn as sns

plt.scatter(df["height"], df["weight"], alpha=0.4)
plt.xlabel("Height")
plt.ylabel("Weight")
plt.show()

Ein Streudiagramm lesen

Achten Sie auf die Richtung (aufwärts = positive Beziehung, abwärts = negative Beziehung), die Stärke (enges Band im Vergleich zu einer verstreuten Punktwolke) und die Form (linear oder gekrümmt).

Fügen Sie mit sns.scatterplot einen hue hinzu, um Punkte nach einer Kategorie einzufärben und Gruppenstrukturen sichtbar zu machen.

sns.scatterplot(x="height", y="weight", hue="gender", data=df, alpha=0.5)
plt.show()

Korrelation mit df.corr()

df.corr() berechnet die paarweise Pearson-Korrelation zwischen numerischen Spalten: eine Zahl zwischen -1 und +1.

  • +1 → perfekte positive lineare Beziehung
  • 0 → keine lineare Beziehung
  • -1 → perfekte negative lineare Beziehung
corr = df.corr(numeric_only=True)
print(corr["price"].sort_values(ascending=False))

Korrelations-Heatmaps

Eine Korrelationsmatrix lässt sich als Heatmap leichter lesen. Übergeben Sie annot=True, um die Werte in den einzelnen Zellen auszugeben.

Verwenden Sie eine divergierende Farbkarte (z. B. coolwarm), damit positive und negative Korrelationen unterschiedliche Farben erhalten.

corr = df.corr(numeric_only=True)
sns.heatmap(corr, annot=True, fmt=".2f", cmap="coolwarm", center=0)
plt.show()

Multikollinearität erkennen

Wenn zwei Merkmale sehr stark korrelieren (z. B. > 0,9), enthalten sie redundante Informationen. Das ist Multikollinearität, die lineare Modelle instabil machen kann.

In der Heatmap springen redundante Merkmalspaare ins Auge, sodass Sie eines davon entfernen können.

corr = df.corr(numeric_only=True).abs()
high = corr[(corr > 0.9) & (corr < 1.0)]
print(high.dropna(how="all"))

Korrelation ist keine Kausalität

Eine starke Korrelation bedeutet nicht, dass eine Variable die andere verursacht. Beide könnten durch eine verborgene dritte Variable beeinflusst werden, oder der Zusammenhang könnte zufällig sein.

Verwenden Sie Korrelationen, um Hypothesen aufzustellen, und überprüfen Sie diese anschließend mit Fachwissen und kontrollierten Analysen.

Pairplots mit sns.pairplot

sns.pairplot zeichnet ein Raster aus Streudiagrammen für jedes Paar numerischer Spalten und zeigt auf der Diagonalen Histogramme oder KDEs.

Das ist der schnellste Weg, alle bivariaten Beziehungen auf einmal grob zu überblicken. Begrenzen Sie bei großen Datensätzen die Anzahl der Spalten – der Aufwand wächst quadratisch mit der Spaltenzahl.

sns.pairplot(df[["height", "weight", "age", "income"]], hue="gender")
plt.show()

Gruppierte Boxplots

Um eine numerische Variable mit einer kategorialen Variable in Beziehung zu setzen, platzieren Sie die Kategorie auf der x-Achse eines Boxplots. So vergleichen Sie Verteilungen über mehrere Gruppen hinweg sofort.

sns.boxplot(x="city", y="income", data=df)
plt.xticks(rotation=45)
plt.show()

Gruppierte Aggregationen

Kennzahlen ergänzen Diagramme. Mit groupby und agg fassen Sie eine numerische Spalte über Kategorien hinweg zusammen.

Das ist multivariate Analyse in Tabellenform – vergleichen Sie Mittelwerte, Mediane und Anzahlen direkt nebeneinander.

summary = df.groupby("city")["income"].agg(["mean", "median", "count"])
print(summary.sort_values("mean", ascending=False))

Multivariate Diagramme mit visuellen Kodierungen

Mit visuellen Kodierungen können Sie drei oder mehr Variablen in einem Diagramm darstellen: x, y, Farbe (hue) und Größe.

So sehen Sie, wie sich Beziehungen entlang einer dritten Dimension verändern, ohne separate Diagramme erstellen zu müssen.

sns.scatterplot(x="height", y="weight", hue="age", size="income", data=df)
plt.show()

Schnelltest: Korrelationsbereich

Sie führen df.corr() aus und sehen zwischen zwei Merkmalen den Wert -0.85.

Zusammenfassung: Bivariate und multivariate Analyse

Sie können nun Beziehungen zwischen Variablen untersuchen:

  • plt.scatter / sns.scatterplot für zwei numerische Variablen
  • df.corr() + sns.heatmap(annot=True) für die Korrelationsmatrix
  • Hohe Korrelationen weisen auf Multikollinearität hin (redundante Merkmale entfernen)
  • sns.pairplot für eine Übersicht aller Paare
  • Gruppierte Boxplots und groupby().agg() für numerische und kategoriale Variablen

Als Nächstes setzen wir die Merkmale direkt mit der Zielvariable in Beziehung.

Häufig gestellte Fragen

Ist die Lektion „Bivariate und multivariate Analyse“ kostenlos?

Ja — der vollständige Text von „Bivariate und multivariate Analyse“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Bivariate und multivariate Analyse“?

Streudiagramme, Pairplots, Korrelations-Heatmaps und gruppierte Statistiken. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Bivariate und multivariate Analyse“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. EDA-Workflow und Datenprofiling
  2. Univariate Analyse
  3. Bivariate und multivariate Analyse
  4. Feature-Verteilung und Zielvariable analysieren
← Zurück zu Learn AI with Python