Termhäufigkeit und inverse Dokumenthäufigkeit
Die beiden Hälften des Scores
Termhäufigkeit und inverse Dokumenthäufigkeit ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Zwei Hälften eines Werts
TF-IDF besteht aus zwei miteinander multiplizierten Teilen: Termhäufigkeit und inverser Dokumenthäufigkeit. Jede Hälfte behebt eine andere Schwäche roher Zählungen.
Termhäufigkeit einfach erklärt
Die Termhäufigkeit misst, wie oft ein Wort in einem Dokument vorkommt. Mehrere Erwähnungen eines Wortes deuten darauf hin, dass das Dokument sich diesem Thema zuwendet.
TF normalisieren
Oft teilen wir die Anzahl eines Wortes durch die Dokumentlänge. Diese Normalisierung verhindert, dass lange Dokumente allein deshalb wichtig erscheinen, weil sie mehr Wörter enthalten.
count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))TF allein reicht nicht aus
Die Termfrequenz belohnt für sich genommen weiterhin Füllwörter, die häufig vorkommen. Wir benötigen einen zweiten Faktor, der Wörter abwertet, die überall auftauchen.
Dokumentfrequenz
Die Dokumentfrequenz zählt, in wie vielen Dokumenten ein Wort überhaupt vorkommt. Eine hohe Dokumentfrequenz bedeutet, dass das Wort in Ihrer gesamten Sammlung häufig ist.
Umkehren: der inverse Wert
Wir möchten, dass seltene Wörter hohe Werte erhalten, also kehren wir diese Zählung um. Die inverse Dokumentfrequenz steigt, wenn ein Wort in wenigen Dokumenten vorkommt, und sinkt, wenn es überall zu finden ist.
Der Logarithmus zähmt die Werte
IDF verwendet einen Logarithmus, damit die Werte bei sehr seltenen Wörtern nicht explodieren. Der Logarithmus hält die Skala gleichmäßig und zwischen Begriffen vergleichbar.
import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))Beide Werte multiplizieren
Der endgültige Wert ist einfach TF mal IDF. Ein Wort erzielt nur dann einen hohen Wert, wenn es hier häufig und anderswo selten ist – genau diese Kombination wollten wir.
tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))Was hohe Werte erhält
Ein Themenwort wie neuroscience in einem Artikel erhält einen hohen Wert. Ein Wort wie the wird hingegen stark abgewertet, weil seine IDF fast null ist.
Was niedrige Werte erhält
Wörter, die in fast jedem Dokument vorkommen, erhalten winzige Gewichtungen. TF-IDF stuft dieses Hintergrund-Rauschen automatisch herab, ganz ohne manuelle Stopwortliste.
Warum es so gut funktioniert
TF-IDF gleicht lokale Bedeutung und globale Seltenheit in einer klaren Formel aus. Dieses Gleichgewicht ist der Grund, warum diese Gewichtung seit Jahrzehnten ein fester Bestandteil von Suchsystemen und Textverarbeitung ist. ⭐
Kurze Überprüfung
Was belohnt der Teil mit der inversen Dokumentfrequenz tatsächlich?
Zusammenfassung
TF misst die lokale Häufigkeit, IDF belohnt globale Seltenheit, und ihr Produkt ist TF-IDF. Gemeinsam rücken sie Wörter in den Mittelpunkt, die ein Dokument tatsächlich charakterisieren. ✅
Lerne Python mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 30
- Lektionen
- 120
Häufig gestellte Fragen
Ist die Lektion „Termhäufigkeit und inverse Dokumenthäufigkeit“ kostenlos?
Ja — der vollständige Text von „Termhäufigkeit und inverse Dokumenthäufigkeit“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Termhäufigkeit und inverse Dokumenthäufigkeit“?
Die beiden Hälften des Scores Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um NLP Academy zu starten?
Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Termhäufigkeit und inverse Dokumenthäufigkeit“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?
Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Das Problem mit Rohzählungen
- Termhäufigkeit und inverse Dokumenthäufigkeit
- TF-IDF mit scikit-learn
- Die wichtigsten Wörter finden