0Pricing
Learn AI with Python · Aula

Embeddings GloVe e FastText

Estatísticas globais de coocorrência, FastText baseado em subpalavras e carregamento de embeddings pré-treinados.

Embeddings GloVe e FastText é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 4 aulas no total.

Além de Word2Vec

Word2Vec aprende a partir de janelas de contexto locais. Duas outras representações vetoriais influentes adotam abordagens diferentes: GloVe usa estatísticas globais, e FastText usa fragmentos de caracteres.

O que é GloVe

GloVe (Vetores Globais) é treinado em uma matriz de coocorrência global: quantas vezes cada par de palavras aparece junto em todo o corpus, e não apenas em janelas locais.

Por que estatísticas globais ajudam

Ao fatorar a matriz de coocorrência completa, GloVe captura relações e proporções entre palavras em todo o corpus, produzindo frequentemente vetores de alta qualidade que rivalizam com Word2Vec ou o superam em tarefas de analogia.

Carregando vetores pré-treinados

Treinar representações vetoriais exige corpora enormes, por isso geralmente baixamos representações pré-treinadas. gensim.downloader obtém modelos populares, como os vetores GloVe, com uma única linha.

import gensim.downloader as api

glove = api.load("glove-wiki-gigaword-100")
print(glove["computer"].shape)   # (100,)

Usando GloVe pré-treinado

Depois de carregados, os vetores GloVe aceitam as mesmas operações que Word2Vec: similaridade e analogias.

import gensim.downloader as api

glove = api.load("glove-wiki-gigaword-100")
print(glove.most_similar("king", topn=3))
print(glove.most_similar(positive=["king", "woman"], negative=["man"], topn=1))

O problema das palavras fora do vocabulário

Word2Vec e GloVe atribuem vetores apenas às palavras vistas durante o treinamento. Uma palavra nova ou escrita incorretamente (fora do vocabulário, OOV) não tem vetor, uma limitação real para textos desorganizados.

O que é FastText

FastText resolve OOV representando cada palavra como um conjunto de n-gramas de caracteres. A palavra "jogando" inclui fragmentos como "jog", "oga" e "gan", por isso compartilha estrutura com palavras relacionadas.

Como n-gramas de caracteres ajudam

Como o vetor de uma palavra é construído a partir das suas subpartes, FastText consegue criar um vetor para uma palavra não vista usando os seus n-gramas. Ele também captura a morfologia, ajudando com prefixos, sufixos e palavras raras.

Treinando FastText

O gensim fornece FastText com uma API semelhante à do Word2Vec. Os parâmetros min_n e max_n definem o intervalo dos n-gramas de caracteres.

from gensim.models import FastText

model = FastText(
    sentences,
    vector_size=100,
    window=5,
    min_count=1,
    min_n=3,
    max_n=6,
)

FastText lida com OOV

Até uma palavra nunca vista durante o treinamento retorna um vetor, montado a partir dos seus n-gramas de caracteres. Essa é a vantagem característica do FastText em relação a Word2Vec e GloVe.

from gensim.models import FastText

model = FastText(sentences, vector_size=100, min_n=3, max_n=6, min_count=1)
# works even if "catlike" was never in training
vec = model.wv["catlike"]

Escolhendo uma representação vetorial

Use GloVe ou Word2Vec para textos limpos com um vocabulário fixo. Escolha FastText para idiomas morfologicamente ricos, textos ruidosos ou quando palavras OOV são comuns. Em todos os casos, as representações pré-treinadas são um excelente ponto de partida.

Verificação rápida

Teste os seus conhecimentos sobre representações vetoriais.

Recapitulação

Recapitulação: GloVe aprende com estatísticas globais de coocorrência; FastText usa n-gramas de caracteres para lidar com palavras fora do vocabulário e com a morfologia. Carregue vetores pré-treinados com gensim.downloader.load. Ambos aceitam similaridade e analogias. Escolha FastText para textos ruidosos ou morfologicamente ricos e GloVe/Word2Vec para vocabulários limpos e fixos.

Perguntas Frequentes

A aula “Embeddings GloVe e FastText” é grátis?

Sim — o texto completo de “Embeddings GloVe e FastText” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 4 aulas no total.

O que vou aprender em “Embeddings GloVe e FastText”?

Estatísticas globais de coocorrência, FastText baseado em subpalavras e carregamento de embeddings pré-treinados. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Learn AI with Python?

Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Embeddings GloVe e FastText”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Learn AI with Python?

Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Word2Vec: Skip-gram e CBOW
  2. Embeddings GloVe e FastText
  3. Classificação de texto com BERT
  4. Similaridade semântica e embeddings de sentenças
← Voltar para Learn AI with Python