NLP Academy · Lektion

Multi-Head-Attention und Positionen

Viele Perspektiven plus Bewusstsein für die Reihenfolge

Lektion 3 von 413 Schritte

Multi-Head-Attention und Positionen ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.

Ein Kopf ist begrenzt

Ein einzelner Attention-Head kann jeweils nur eine Art von Beziehung verfolgen. Natürliche Sprache erfordert, dass viele Muster gleichzeitig erkannt werden. 🧠

Viele Köpfe, viele Perspektiven

Multi-Head-Attention führt mehrere Attention-Berechnungen parallel aus, jeweils mit eigenen gelernten Projektionen und einem eigenen Fokus.

Was jeder Head lernt

Ein Head verfolgt möglicherweise Subjekt-Verb-Beziehungen, während ein anderer Pronomen verfolgt. Zusammen erfassen sie ein deutlich umfassenderes Bild des Satzes.

Dimensionen aufteilen

Das Modell teilt seine Vektorgröße auf die Heads auf, sodass jeder Head in einem kleineren Unterraum arbeitet. Der gesamte Rechenaufwand bleibt ungefähr gleich.

d_head = d_model // num_heads

Die Heads zusammenführen

Nachdem jeder Head eine Ausgabe erzeugt hat, konkatenieren Sie sie und leiten das Ergebnis durch eine weitere lineare Schicht, um die Perspektiven zu vermischen.

out = concat(head_1, head_2, ...) @ W_o

Attention ignoriert die Reihenfolge

Self-Attention behandelt die Eingabe wie eine Menge und kann daher allein nicht zwischen „dog bites man“ und „man bites dog“ unterscheiden. Sie ist reihenfolgeblind.

Positionsinformationen hinzufügen

Um das zu beheben, fügen wir jedem Wort ein Positions-Encoding hinzu, damit das Modell weiß, wo sich jedes Token in der Sequenz befindet.

Sinusförmige Encodings

Der ursprüngliche Transformer verwendet feste Sinus- und Kosinus-Wellen mit unterschiedlichen Frequenzen, um jeder Position ein eindeutiges, gleichmäßiges Merkmal zu geben.

pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))

Addieren statt anhängen

Positionsvektoren werden zu den Wort-Embeddings addiert, nicht an deren Ende angehängt. So trägt jedes Token sowohl seine Bedeutung als auch seine Position in sich.

x = token_embeddings + positional_encoding

Auch Positionen können gelernt werden

Viele moderne Modelle ersetzen feste Wellen durch gelernte Positions-Embeddings, die zusammen mit allem anderen trainiert werden und dadurch flexibler sind.

Warum beides wichtig ist

Multi-Head-Attention erkennt viele Beziehungen, Positions-Encodings stellen die Reihenfolge wieder her. Zusammen ermöglichen sie es dem Transformer, Sequenzen wirklich zu verstehen. ✨

Kurzer Test

Lassen Sie uns Positionen und Heads testen.

Zusammenfassung

Sie haben gesehen, wie Multi-Head-Attention viele Beziehungen parallel erfasst, während Positions-Encodings dem Modell ein Gefühl für Reihenfolge geben. 🎯

Kostenlos starten

Lerne Python mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
30
Lektionen
120

Häufig gestellte Fragen

Ist die Lektion „Multi-Head-Attention und Positionen“ kostenlos?

Ja — der vollständige Text von „Multi-Head-Attention und Positionen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Multi-Head-Attention und Positionen“?

Viele Perspektiven plus Bewusstsein für die Reihenfolge Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um NLP Academy zu starten?

Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Multi-Head-Attention und Positionen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?

Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Die Idee der Attention
  2. Self-Attention Schritt für Schritt
  3. Multi-Head-Attention und Positionen
  4. Im Inneren des Transformer-Blocks
← Zurück zu NLP Academy