Embeddings GloVe e FastText
Estatísticas globais de coocorrência, FastText baseado em subpalavras e carregamento de embeddings pré-treinados.
Embeddings GloVe e FastText é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 4 aulas no total.
Além de Word2Vec
Word2Vec aprende a partir de janelas de contexto locais. Duas outras representações vetoriais influentes adotam abordagens diferentes: GloVe usa estatísticas globais, e FastText usa fragmentos de caracteres.
O que é GloVe
GloVe (Vetores Globais) é treinado em uma matriz de coocorrência global: quantas vezes cada par de palavras aparece junto em todo o corpus, e não apenas em janelas locais.
Por que estatísticas globais ajudam
Ao fatorar a matriz de coocorrência completa, GloVe captura relações e proporções entre palavras em todo o corpus, produzindo frequentemente vetores de alta qualidade que rivalizam com Word2Vec ou o superam em tarefas de analogia.
Carregando vetores pré-treinados
Treinar representações vetoriais exige corpora enormes, por isso geralmente baixamos representações pré-treinadas. gensim.downloader obtém modelos populares, como os vetores GloVe, com uma única linha.
import gensim.downloader as api
glove = api.load("glove-wiki-gigaword-100")
print(glove["computer"].shape) # (100,)Usando GloVe pré-treinado
Depois de carregados, os vetores GloVe aceitam as mesmas operações que Word2Vec: similaridade e analogias.
import gensim.downloader as api
glove = api.load("glove-wiki-gigaword-100")
print(glove.most_similar("king", topn=3))
print(glove.most_similar(positive=["king", "woman"], negative=["man"], topn=1))O problema das palavras fora do vocabulário
Word2Vec e GloVe atribuem vetores apenas às palavras vistas durante o treinamento. Uma palavra nova ou escrita incorretamente (fora do vocabulário, OOV) não tem vetor, uma limitação real para textos desorganizados.
O que é FastText
FastText resolve OOV representando cada palavra como um conjunto de n-gramas de caracteres. A palavra "jogando" inclui fragmentos como "jog", "oga" e "gan", por isso compartilha estrutura com palavras relacionadas.
Como n-gramas de caracteres ajudam
Como o vetor de uma palavra é construído a partir das suas subpartes, FastText consegue criar um vetor para uma palavra não vista usando os seus n-gramas. Ele também captura a morfologia, ajudando com prefixos, sufixos e palavras raras.
Treinando FastText
O gensim fornece FastText com uma API semelhante à do Word2Vec. Os parâmetros min_n e max_n definem o intervalo dos n-gramas de caracteres.
from gensim.models import FastText
model = FastText(
sentences,
vector_size=100,
window=5,
min_count=1,
min_n=3,
max_n=6,
)FastText lida com OOV
Até uma palavra nunca vista durante o treinamento retorna um vetor, montado a partir dos seus n-gramas de caracteres. Essa é a vantagem característica do FastText em relação a Word2Vec e GloVe.
from gensim.models import FastText
model = FastText(sentences, vector_size=100, min_n=3, max_n=6, min_count=1)
# works even if "catlike" was never in training
vec = model.wv["catlike"]Escolhendo uma representação vetorial
Use GloVe ou Word2Vec para textos limpos com um vocabulário fixo. Escolha FastText para idiomas morfologicamente ricos, textos ruidosos ou quando palavras OOV são comuns. Em todos os casos, as representações pré-treinadas são um excelente ponto de partida.
Verificação rápida
Teste os seus conhecimentos sobre representações vetoriais.
Recapitulação
Recapitulação: GloVe aprende com estatísticas globais de coocorrência; FastText usa n-gramas de caracteres para lidar com palavras fora do vocabulário e com a morfologia. Carregue vetores pré-treinados com gensim.downloader.load. Ambos aceitam similaridade e analogias. Escolha FastText para textos ruidosos ou morfologicamente ricos e GloVe/Word2Vec para vocabulários limpos e fixos.
Perguntas Frequentes
A aula “Embeddings GloVe e FastText” é grátis?
Sim — o texto completo de “Embeddings GloVe e FastText” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 4 aulas no total.
O que vou aprender em “Embeddings GloVe e FastText”?
Estatísticas globais de coocorrência, FastText baseado em subpalavras e carregamento de embeddings pré-treinados. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Learn AI with Python?
Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Embeddings GloVe e FastText”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Learn AI with Python?
Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Word2Vec: Skip-gram e CBOW
- Embeddings GloVe e FastText
- Classificação de texto com BERT
- Similaridade semântica e embeddings de sentenças