NLP Academy · Aula

Dividindo e gerando embeddings de documentos

Prepare uma base de conhecimento pesquisável.

Aula 2 de 413 etapas

Dividindo e gerando embeddings de documentos é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Os documentos são grandes demais para pesquisar por inteiro

Um PDF longo reúne muitos tópicos ao mesmo tempo. Para recuperar informações com precisão, primeiro divida-o em partes menores chamadas segmentos.

O que torna um bom segmento

Um bom segmento apresenta uma ideia coerente: um ou dois parágrafos. Se for grande demais, a resposta ficará escondida; se for pequeno demais, perderá o contexto ao redor.

Divisão por tamanho

O método mais simples corta o texto a cada número fixo de caracteres ou tokens. É rápido, mas pode cortar uma frase ao meio.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Segmentos sobrepostos

Para evitar separar uma ideia, permita que os segmentos tenham uma sobreposição. Repetir as últimas linhas mantém o contexto fluindo entre os limites.

Divisão por estrutura

Divisores mais inteligentes separam primeiro por parágrafos ou títulos. Respeitar a estrutura mantém cada segmento concentrado em um único tópico claro.

Do texto aos vetores

A pesquisa precisa de números, não de palavras. Uma incorporação transforma cada segmento em um vetor denso que captura seu significado.

O significado está na distância

As incorporações posicionam textos semelhantes próximos uns dos outros. Dois segmentos sobre a mesma ideia ficam próximos no espaço vetorial.

Chamando um modelo de incorporação

Você passa o texto para um modelo de incorporação e recebe uma lista de números de ponto flutuante. O mesmo modelo deve codificar tanto os segmentos quanto as consultas.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Codificando seus segmentos

Execute cada segmento no modelo para criar seu vetor. Uma única chamada pode encode a lista inteira de uma vez, com mais rapidez.

vectors = model.encode(chunks)

Dimensões dos vetores

Cada vetor tem um comprimento fixo, sua dimensão. Um modelo pequeno pode fornecer 384 números; modelos maiores fornecem 768 ou mais.

print(vectors.shape)  # (n_chunks, 384)

Armazene o segmento e o vetor juntos

Mantenha cada vetor associado ao seu texto original e à sua fonte. Mais tarde, você recuperará pelo vetor, mas exibirá o segmento legível por humanos.

Verificação rápida

Pense por que adicionamos sobreposição ao dividir documentos.

Recapitulação

Você divide os documentos em segmentos, opcionalmente sobrepostos, e depois transforma cada um em um vetor. Armazene o texto e o vetor juntos para a recuperação. ✅

Grátis para começar

Aprenda Python com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Dividindo e gerando embeddings de documentos” é grátis?

Sim — o texto completo de “Dividindo e gerando embeddings de documentos” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Dividindo e gerando embeddings de documentos”?

Prepare uma base de conhecimento pesquisável. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Dividindo e gerando embeddings de documentos”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Por que LLMs precisam de recuperação
  2. Dividindo e gerando embeddings de documentos
  3. Busca vetorial com um armazenamento vetorial
  4. Integrando a recuperação ao prompt
← Voltar para NLP Academy