0Pricing
Python Academy · Lektion

Grundlegende Konzepte des bestärkenden Lernens

Agent, Umgebung, Belohnungen und Bestrafungen

Grundlegende Konzepte des bestärkenden Lernens ist eine kostenlose Python Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Python Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.

Was ist Reinforcement Learning?

Grundlegende Konzepte des Reinforcement Learning

Reinforcement Learning (RL) ist eine Form des maschinellen Lernens, bei der ein Agent durch die Interaktion mit einer Umgebung lernt, Entscheidungen zu treffen. Das Ziel besteht darin, die Belohnungen im Laufe der Zeit zu maximieren.

Zu den wichtigsten Bestandteilen des RL gehören Agenten, Umgebungen, Belohnungen und Bestrafungen.

Grundlegende Konzepte des bestärkenden Lernens — Illustration 1

Wichtige Begriffe im RL

Wichtige Begriffe im RL

Wichtige Begriffe im Reinforcement Learning:

  • Agent: Der Entscheidungsträger, beispielsweise ein Roboter oder eine Software.
  • Umgebung: Das System, mit dem der Agent interagiert.
  • Zustand: Die aktuelle Situation der Umgebung.
  • Aktion: Die vom Agenten getroffene Entscheidung.
  • Belohnung: Rückmeldung der Umgebung zu einer Aktion.

Interaktion zwischen Agent und Umgebung

Interaktion zwischen Agent und Umgebung

Die Interaktion zwischen Agent und Umgebung lässt sich wie folgt zusammenfassen:

  1. Der Agent beobachtet den aktuellen Zustand der Umgebung.
  2. Der Agent führt basierend auf einer Policy eine Aktion aus.
  3. Die Umgebung wechselt in einen neuen Zustand und gibt eine Belohnung aus.

Diese Schleife wird fortgesetzt, bis ein Endzustand erreicht ist.

Belohnungen und Bestrafungen

Belohnungen und Bestrafungen

Belohnungen sind Rückmeldungen, die der Agent für seine Aktionen erhält. Das Ziel besteht darin, die kumulative Belohnung im Laufe der Zeit zu maximieren. Bestrafungen sind negative Belohnungen, die unerwünschte Aktionen verhindern.

Beispielsweise:

  • Belohnung: +10 für das Erreichen eines Ziels.
  • Bestrafung: -5 für das Auftreffen auf ein Hindernis.

Policies im RL

Policies im RL

Eine Policy ist eine Strategie, mit der der Agent basierend auf dem aktuellen Zustand Aktionen auswählt.

Arten von Policies:

  • Deterministisch: Wählt für einen bestimmten Zustand immer dieselbe Aktion aus.
  • Stochastisch: Wählt Aktionen auf probabilistische Weise aus.

Exploration und Exploitation

Exploration und Exploitation

Der Agent steht vor einem Zielkonflikt zwischen:

  • Exploration: Ausprobieren neuer Aktionen, um mehr über die Umgebung zu erfahren.
  • Exploitation: Auswählen von Aktionen, die die bisher höchste bekannte Belohnung liefern.

Das Ausbalancieren dieser beiden Aspekte ist für effektives Lernen entscheidend.

Markov-Entscheidungsprozess (MDP)

Markov-Entscheidungsprozess (MDP)

Probleme des Reinforcement Learning werden häufig als MDP modelliert, das folgendermaßen definiert ist:

  • Zustände (S): Mögliche Konfigurationen der Umgebung.
  • Aktionen (A): Für den Agenten verfügbare Auswahlmöglichkeiten.
  • Belohnungen (R): Rückmeldungen zu Aktionen.
  • Übergangswahrscheinlichkeiten (P): Wahrscheinlichkeit für den Wechsel zwischen Zuständen.

Herausforderungen beim Reinforcement Learning

Herausforderungen beim Reinforcement Learning

Reinforcement Learning bringt einige Herausforderungen mit sich:

  • Verzögerte Belohnungen: Belohnungen werden möglicherweise erst nach mehreren Aktionen erhalten.
  • Spärliche Belohnungen: Belohnungen treten möglicherweise nur selten auf.
  • Hohe Dimensionalität: Komplexe Umgebungen mit vielen Zuständen und Aktionen.

Zusammenfassung und nächste Schritte

Zusammenfassung und nächste Schritte

In dieser Lektion haben wir:

  • Die grundlegenden Konzepte des Reinforcement Learning untersucht, darunter Agenten, Umgebungen und Belohnungen.
  • Policies, Exploration und Exploitation sowie MDPs besprochen.
  • Die Herausforderungen des RL kennengelernt.

Als Nächstes beschäftigen wir uns mit dem Konzept der Q-Table, einem grundlegenden Ansatz des Reinforcement Learning.

Grundlegende Konzepte des bestärkenden Lernens — Illustration 10

Häufig gestellte Fragen

Ist die Lektion „Grundlegende Konzepte des bestärkenden Lernens“ kostenlos?

Ja — der vollständige Text von „Grundlegende Konzepte des bestärkenden Lernens“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Python Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.

Was lerne ich in „Grundlegende Konzepte des bestärkenden Lernens“?

Agent, Umgebung, Belohnungen und Bestrafungen Du übst Python Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Python Academy zu starten?

Keine Vorkenntnisse erforderlich. Python Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 5.

Wie lange dauert die Lektion „Grundlegende Konzepte des bestärkenden Lernens“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Python Academy-Lektion Code schreiben und ausführen?

Ja. Jede Python Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Grundlegende Konzepte des bestärkenden Lernens
  2. Das Konzept der Q-Tabelle
  3. Q-Tabelle in Python implementieren
  4. Deep Q-Learning
  5. OpenAI Gym erkunden
← Zurück zu Python Academy