0Pricing
AI Engineering Academy · Lektion

Wie LLMs trainiert werden

Sie lernen die Phasen des LLM-Trainings kennen: Pre-Training auf umfangreichen Korpora, überwachte Feinabstimmung und RLHF – und warum jede Phase für das Modellverhalten wichtig ist.

Wie LLMs trainiert werden ist eine kostenlose AI Engineering Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Engineering Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

Three Stages of LLM Training

LLMs werden in drei Phasen aufgebaut: Das Pre-Training vermittelt Sprache und Wissen, das Fine-Tuning lehrt das Befolgen von Anweisungen und RLHF richtet das Modell auf die Wünsche der Menschen aus.

Pre-Training: Next Token Prediction at Scale

Das Pre-Training füttert das Modell mit Massen von Text für eine einzige Aufgabe: das nächste Token vorherzusagen. Dieses einfache Ziel reicht aus, um nebenbei Grammatik, Fakten und logisches Denken zu vermitteln.

Training Data Quality and Curation

Unbearbeiteter Internettext ist chaotisch. Teams bereinigen ihn mit Daten-Pipelines, die filtern, deduplizieren und die Qualität bewerten. Die Faustregel: Bessere Daten schlagen ein größeres Modell.

The Loss Function and Optimization

Das Training minimiert den Cross-Entropy-Verlust — wie weit die Vermutung des Modells vom richtigen nächsten Token entfernt ist. Winzige Gewichtungsanpassungen, die Milliarden Mal wiederholt werden. Der Code zeigt die Mathematik.

# Illustrative cross-entropy loss for a single token prediction
import math

vocab_size = 50000
correct_token_index = 4217  # index for the word 'Paris'

# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size  # simplified uniform base
model_probs[correct_token_index] = 0.70  # model is 70% confident in 'Paris'

loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}')  # ~0.3567

Emergent Capabilities from Scale

Bei ausreichendem Maßstab erscheinen neue emergente Fähigkeiten — wie schrittweises Schließen —, über die kleine Modelle einfach nicht verfügen. Niemand hat sie direkt trainiert; der Maßstab hat sie hervorgebracht.

Supervised Fine-Tuning on Instruction Pairs

Ein Basismodell setzt einfach nur Text fort. Supervised Fine-Tuning trainiert es anhand von (Anweisungs-, ideale Antwort)-Paaren, sodass es lernt, tatsächlich zu antworten, anstatt weiterzuschwafeln.

# Illustrative SFT data format
training_example = {
    'messages': [
        {'role': 'system', 'content': 'You are a helpful assistant.'},
        {'role': 'user', 'content': 'What is the capital of France?'},
        {'role': 'assistant', 'content': 'The capital of France is Paris.'}
    ]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained on

RLHF Phase 1: Training the Reward Model

RLHF beginnt mit einem Präferenzmodell. Menschen wählen die bessere von zwei Antworten aus, und das Präferenzmodell lernt, diese Präferenzen vorherzusagen – als Stellvertreter für den menschlichen Geschmack.

RLHF Phase 2: PPO Fine-Tuning

Als Nächstes optimiert PPO das LLM, um beim Bewertungsmodell besser abzuschneiden. Eine KL-Strafe verhindert, dass es völlig entgleist und das System austrickst, anstatt wirklich zu helfen.

Direct Preference Optimization: Simpler RLHF

PPO ist komplex. DPO ist eine einfachere Alternative: Es trainiert das Modell direkt anhand von Paaren aus bevorzugten und abgelehnten Antworten – ganz ohne separates Belohnungsmodell.

Chinchilla Scaling Laws: Compute-Optimal Training

Das Chinchilla-Ergebnis: Ältere Modelle waren untertrainiert. Skalieren Sie Daten und Größe bei einem bestimmten Budget gemeinsam — für die besten Ergebnisse etwa 20 Token pro Parameter.

What Each Training Stage Affects

Jede Phase steuert etwas anderes: Pre-Training legt fest, was sie weiß, Fine-Tuning legt fest, wie sie sich verhält, und RLHF legt ihre Werte fest. Das verrät Ihnen, welchen Teil Sie korrigieren müssen.

Quick Check

Teste dein Verständnis der AI-Engineering-Konzepte aus dieser Lektion.

Lesson Recap

Zusammenfassung: Pre-Training baut Wissen auf, Fine-Tuning sorgt für die Befolgung von Anweisungen und RLHF oder DPO richtet das Modell an menschlichen Werten aus. Als Nächstes: Was LLMs können und was nicht. 💡

Häufig gestellte Fragen

Ist die Lektion „Wie LLMs trainiert werden“ kostenlos?

Ja — der vollständige Text von „Wie LLMs trainiert werden“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Engineering Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Wie LLMs trainiert werden“?

Sie lernen die Phasen des LLM-Trainings kennen: Pre-Training auf umfangreichen Korpora, überwachte Feinabstimmung und RLHF – und warum jede Phase für das Modellverhalten wichtig ist. Du übst AI Engineering Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Engineering Academy zu starten?

Keine Vorkenntnisse erforderlich. AI Engineering Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Wie LLMs trainiert werden“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Engineering Academy-Lektion Code schreiben und ausführen?

Ja. Jede AI Engineering Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Von Autocomplete zu ChatGPT
  2. Transformer und Attention in einfachen Worten
  3. Wie LLMs trainiert werden
  4. Fähigkeiten und Grenzen von LLMs
← Zurück zu AI Engineering Academy