Was Embeddings sind (Vektorrepräsentationen)
Ein Embedding ist eine Zahlenliste, die die Bedeutung eines Textes repräsentiert – ähnliche Texte haben ähnliche Vektoren.
Was Embeddings sind (Vektorrepräsentationen) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Von Text zu Zahlen
Ein Embedding ist eine Liste von Zahlen (ein Vektor), die die Bedeutung eines Textabschnitts repräsentiert. Texte mit ähnlicher Bedeutung haben Vektoren, die im Vektorraum nahe beieinanderliegen.
Warum Vektoren?
Computer können keine mathematischen Operationen mit Wörtern durchführen, mit Zahlen jedoch schon. Embeddings geben jedem Text eine Position in einem höherdimensionalen Raum, sodass wir:
- die Ähnlichkeit zwischen Texten messen können
- verwandte Elemente gruppieren können
- semantisch suchen können (nicht nur nach Schlüsselwörtern)
Ein Beispiel für ein Embedding
Das Modell OpenAI text-embedding-3-small gibt pro Text 1536 Zahlen zurück. Für „hello world“ erhalten Sie etwa:
embedding = [0.0123, -0.0456, 0.0789, 0.0234, -0.0567, 0.0089, -0.0321]
# Real embeddings have ~1536 floats, each between roughly -1 and 1; this is a shortened example.
print("Example embedding (7 of ~1536 dimensions shown):", embedding)
Ähnliche Texte, ähnliche Vektoren
Die folgenden Paare erhalten Vektoren, die nahe beieinanderliegen:
- „king“ und „queen“
- „happy“ und „joyful“
- „car“ und „automobile“
Die Vektoren von „king“ und „pizza“ liegen weit auseinander.
Dimensionalität
Mehr Dimensionen = mehr Nuancen, aber mehr Speicherbedarf. Übliche Größen:
- OpenAI text-embedding-3-small: 1536
- OpenAI text-embedding-3-large: 3072
- Cohere embed-multilingual-v3: 1024
- BGE-small (OSS): 384
Semantisch vs. lexikalisch
Lexikalische Suche (Elasticsearch, BM25) findet Übereinstimmungen bei Schlüsselwörtern. Semantische Suche (Embeddings) findet Übereinstimmungen bei der Bedeutung.
„How to fix my car?“ passt semantisch zu „auto repair tips“ — obwohl kein einziges Wort übereinstimmt.
Embeddings für Dokumente
Sie können Embeddings erstellen für:
- Kurze Abfragen
- Sätze
- Absätze (~500 Tokens sind ein guter Mittelwert)
- Gesamte Dokumente (mit Qualitätseinbußen)
Embeddings für Code
Es gibt spezielle Embedding-Modelle für Code (z. B. Voyage Code, Jina Code), die Programmiersyntax verstehen und bei der Codesuche allgemeine Text-Embeddings übertreffen.
Multimodale Embeddings
Sie können Bilder, Audio und Video in denselben Raum wie Text einbetten — dadurch wird modalitätsübergreifende Suche möglich. CLIP ist das bekannteste Beispiel für Bilder.
Verzerrungen in Embeddings
Embeddings spiegeln ihre Trainingsdaten wider. Sie kodieren Verzerrungen: etwa Verbindungen zwischen Geschlecht und Beruf sowie rassistische Stereotype. Seien Sie sich dessen bewusst, wenn Sie sie für Rangfolgeentscheidungen verwenden, die Menschen betreffen.
Was Embeddings nicht können
- Mathematische Aufgaben lösen
- Logische Schlussfolgerungen ziehen
- Text generieren
- Ursache und Wirkung nachvollziehen
Sie dienen dazu, Ähnlichkeit zu MESSEN, nicht zum SCHLUSSFOLGERN.
Definition von Embeddings
Was ist ein Embedding?
Zusammenfassung
Embeddings wandeln Text in Vektoren um. Vektoren ermöglichen semantische Suche, Clustering und RAG. Als Nächstes erzeugen wir sie mit der OpenAI API.
Häufig gestellte Fragen
Ist die Lektion „Was Embeddings sind (Vektorrepräsentationen)“ kostenlos?
Ja — der vollständige Text von „Was Embeddings sind (Vektorrepräsentationen)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Was Embeddings sind (Vektorrepräsentationen)“?
Ein Embedding ist eine Zahlenliste, die die Bedeutung eines Textes repräsentiert – ähnliche Texte haben ähnliche Vektoren. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Was Embeddings sind (Vektorrepräsentationen)“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Was Embeddings sind (Vektorrepräsentationen)
- Embeddings mit text-embedding-3 erzeugen
- Kosinusähnlichkeit für Retrieval
- Embedding-Modelle im Vergleich (OpenAI vs. Cohere vs. OSS)