0Pricing
AI Engineering Academy · Lektion

Transformer und Attention in einfachen Worten

Sie machen die Transformer-Architektur verständlich, indem Sie untersuchen, wie Attention-Mechanismen Modelle auf relevante Kontexte fokussieren lassen, ohne die Mathematik dahinter verstehen zu müssen.

Transformer und Attention in einfachen Worten ist eine kostenlose AI Engineering Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Engineering Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

The Core Problem: Long-Range Dependencies

In „die Trophäe passte nicht in die Tasche, weil sie zu groß war“, was ist „sie“? Ältere Modelle verloren bei langen Sätzen den Überblick. Das ist das Problem der Langzeitabhängigkeit.

Attention as Weighted Focus

Aufmerksamkeit (Attention) ist die Art und Weise, wie ein Modell entscheidet, welche Wörter für jedes einzelne Wort am wichtigsten sind — so als würde man die Schlüsselstellen eines Textes markieren, anstatt jedes Wort gleich zu behandeln.

Queries, Keys, and Values

Aufmerksamkeit funktioniert wie eine Suche: Jedes Wort sendet eine Abfrage (Query), gleicht sie mit jedem Schlüssel (Key) ab und zieht die relevantesten Werte (Values) heran. Der folgende Code zeigt die Kernidee.

# Simplified self-attention in pseudocode
import numpy as np

def scaled_dot_product_attention(Q, K, V):
    d_k = Q.shape[-1]  # dimension of keys
    scores = Q @ K.T / np.sqrt(d_k)  # scale to prevent vanishing gradients
    weights = np.exp(scores) / np.sum(np.exp(scores), axis=-1, keepdims=True)  # softmax
    output = weights @ V  # weighted sum of values
    return output

Multi-Head Attention: Multiple Perspectives

Ein Attention Head erfasst eine Art von Verbindung. Multi-Head-Attention führt viele davon parallel aus, sodass das Modell Wörter gleichzeitig durch mehrere Linsen betrachtet.

Positional Encodings: Adding Word Order

Aufmerksamkeit allein ignoriert die Wortreihenfolge – „Hund beißt Mann“ sieht aus wie „Mann beißt Hund“. Positionelle Encodings fügen ein Gefühl für die Position hinzu, damit die Reihenfolge nicht verloren geht.

Feed-Forward Layers After Attention

Nachdem der Attention-Mechanismus den Kontext geteilt hat, verarbeitet ein Feed-Forward-Netzwerk jedes Wort für sich. Interessanterweise scheint ein Großteil des faktischen Wissens des Modells hier zu liegen.

Encoder-Only vs Decoder-Only Models

BERT-ähnliche nur-Encoder-Modelle lesen den gesamten Text auf einmal, um ihn zu verstehen. GPT-ähnliche nur-Decoder-Modelle lesen von links nach rechts, um ihn zu generieren – was genau das ist, was ChatGPT tut.

Layer Stacking and Depth

Moderne LLMs stapeln Dutzende Transformer-Blöcke. Jede Schicht verfeinert die vorherige – die frühen erfassen Grammatik, tiefere bewältigen das Schließen. Mehr Tiefe, mehr Denken.

Residual Connections and Layer Normalization

Das Stapeln vieler Schichten ist schwierig. Residuale Verbindungen und Layer-Normalisierung halten das Signal stabil, sodass tiefe Modelle mit über 100 Schichten zuverlässig trainiert werden können.

Why Attention Scales So Well

Attention lässt sich einfach parallel ausführen, sodass mehr GPUs ein schnelleres Training bedeuten. Auf diese Weise trainierten Forscher mit riesigen Datenmengen und entdeckten die berühmten Skalierungsgesetze.

Flash Attention and Modern Optimizations

Lange Eingaben machen die Standard-Aufmerksamkeit sehr speicherintensiv. FlashAttention berechnet dasselbe Ergebnis weitaus effizienter und macht große Kontextfenster praktikabel.

Quick Check

Teste dein Verständnis der AI-Engineering-Konzepte aus dieser Lektion.

Lesson Recap

Zusammenfassung: Self-Attention verknüpft jedes Wort mit jedem anderen, Multi-Head-Attention erfasst viele Beziehungen gleichzeitig, und Residuals sowie Normalisierung ermöglichen tiefe Modelle. Als Nächstes: Wie LLMs trainiert werden.

Häufig gestellte Fragen

Ist die Lektion „Transformer und Attention in einfachen Worten“ kostenlos?

Ja — der vollständige Text von „Transformer und Attention in einfachen Worten“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Engineering Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Transformer und Attention in einfachen Worten“?

Sie machen die Transformer-Architektur verständlich, indem Sie untersuchen, wie Attention-Mechanismen Modelle auf relevante Kontexte fokussieren lassen, ohne die Mathematik dahinter verstehen zu müss… Du übst AI Engineering Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Engineering Academy zu starten?

Keine Vorkenntnisse erforderlich. AI Engineering Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Transformer und Attention in einfachen Worten“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Engineering Academy-Lektion Code schreiben und ausführen?

Ja. Jede AI Engineering Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Von Autocomplete zu ChatGPT
  2. Transformer und Attention in einfachen Worten
  3. Wie LLMs trainiert werden
  4. Fähigkeiten und Grenzen von LLMs
← Zurück zu AI Engineering Academy