0Pricing
NLP Academy · Lección

Frecuencia de término y frecuencia inversa de documento

Las dos partes de la puntuación

Frecuencia de término y frecuencia inversa de documento es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

Two Halves of One Score

TF-IDF is built from two pieces that multiply together: term frequency and inverse document frequency. Each half fixes a different weakness of raw counts.

Term Frequency, Plainly

Term frequency measures how often a word appears inside one document. More mentions of a word suggest that document leans toward that topic.

Normalizing TF

We often divide a word's count by the document length. This normalization stops long documents from looking important just because they have more words.

count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))

TF Alone Isn't Enough

By itself, term frequency still rewards filler words that appear a lot. We need a second factor to punish words that show up everywhere.

Document Frequency

Document frequency counts how many documents contain a word at all. A high document frequency means the word is common across your whole collection.

Flip It: Inverse

We want rare words to score high, so we invert that count. Inverse document frequency rises when a word appears in few documents and falls when it is everywhere.

The Log Tames It

IDF uses a logarithm so the values do not explode for very rare words. The log keeps the scale smooth and comparable across terms.

import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))

Multiply Them Together

The final score is simply TF times IDF. A word wins only if it is frequent here and rare elsewhere, which is exactly the combination we wanted.

tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))

What Scores High

A topic word like neuroscience in one article gets a high score. A word like the gets crushed because its IDF is nearly zero.

What Scores Low

Words appearing in almost every document earn tiny weights. TF-IDF automatically demotes this background noise without any manual stopword list.

Why It Works So Well

TF-IDF balances local importance against global rarity in one clean formula. That balance is why this weighting stayed a search and text staple for decades. ⭐

Quick Check

What does the inverse document frequency part actually reward?

Recap

TF measures local frequency, IDF rewards global rarity, and their product is TF-IDF. Together they spotlight words that truly define a document. ✅

Preguntas frecuentes

¿La lección «Frecuencia de término y frecuencia inversa de documento» es gratis?

Sí — el texto completo de «Frecuencia de término y frecuencia inversa de documento» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Frecuencia de término y frecuencia inversa de documento»?

Las dos partes de la puntuación Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Frecuencia de término y frecuencia inversa de documento»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. El problema de los conteos brutos
  2. Frecuencia de término y frecuencia inversa de documento
  3. TF-IDF con scikit-learn
  4. Búsqueda de las palabras más importantes
← Volver a NLP Academy