Frequência do termo e frequência inversa de documentos
As duas partes da pontuação.
Frequência do termo e frequência inversa de documentos é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Duas Metades de uma Pontuação
O TF-IDF é composto por duas partes que se multiplicam: frequência do termo e frequência inversa do documento. Cada metade corrige uma fraqueza diferente das contagens brutas.
Frequência do Termo, de Forma Simples
A frequência do termo mede quantas vezes uma palavra aparece em um documento. Mais menções a uma palavra sugerem que esse documento se relaciona mais com o respectivo tema.
Normalizando o TF
Geralmente dividimos a contagem de uma palavra pelo comprimento do documento. Essa normalização impede que documentos longos pareçam importantes apenas porque têm mais palavras.
count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))O TF Sozinho Não Basta
Por si só, a frequência do termo ainda favorece palavras vazias que aparecem muitas vezes. Precisamos de um segundo fator para penalizar palavras que aparecem em toda parte.
Frequência do Documento
A frequência do documento conta quantos documentos contêm determinada palavra. Uma frequência do documento alta significa que a palavra é comum em toda a sua coleção.
Inverta: o Inverso
Queremos que palavras raras tenham uma pontuação alta, então invertemos essa contagem. A frequência inversa do documento aumenta quando uma palavra aparece em poucos documentos e diminui quando aparece em toda parte.
O Logaritmo Controla os Valores
O IDF usa um logaritmo para que os valores não disparem no caso de palavras muito raras. O log mantém a escala suave e comparável entre os termos.
import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))Multiplicando os Dois Fatores
A pontuação final é simplesmente TF vezes IDF. Uma palavra só se destaca se for frequente aqui e rara em outros lugares, exatamente a combinação que queríamos.
tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))O Que Recebe Pontuação Alta
Uma palavra relacionada ao tema, como neuroscience, em um artigo recebe uma pontuação alta. Uma palavra como the é reduzida porque seu IDF é quase zero.
O Que Recebe Pontuação Baixa
Palavras que aparecem em quase todos os documentos recebem pesos muito pequenos. O TF-IDF rebaixa automaticamente esse ruído de fundo sem nenhuma lista manual de palavras irrelevantes.
Por Que Funciona Tão Bem
O TF-IDF equilibra a importância local e a raridade global em uma única fórmula simples. É por isso que essa ponderação continua sendo fundamental em pesquisas e textos há décadas. ⭐
Verificação Rápida
O que a parte da frequência inversa do documento realmente favorece?
Recapitulação
O TF mede a frequência local, o IDF favorece a raridade global, e o produto dos dois é o TF-IDF. Juntos, eles destacam palavras que realmente definem um documento. ✅
Perguntas Frequentes
A aula “Frequência do termo e frequência inversa de documentos” é grátis?
Sim — o texto completo de “Frequência do termo e frequência inversa de documentos” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Frequência do termo e frequência inversa de documentos”?
As duas partes da pontuação. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Frequência do termo e frequência inversa de documentos”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- O problema das contagens brutas
- Frequência do termo e frequência inversa de documentos
- TF-IDF com scikit-learn
- Encontrando as palavras mais importantes