Dividindo e gerando embeddings de documentos
Prepare uma base de conhecimento pesquisável.
Dividindo e gerando embeddings de documentos é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Os documentos são grandes demais para pesquisar por inteiro
Um PDF longo reúne muitos tópicos ao mesmo tempo. Para recuperar informações com precisão, primeiro divida-o em partes menores chamadas segmentos.
O que torna um bom segmento
Um bom segmento apresenta uma ideia coerente: um ou dois parágrafos. Se for grande demais, a resposta ficará escondida; se for pequeno demais, perderá o contexto ao redor.
Divisão por tamanho
O método mais simples corta o texto a cada número fixo de caracteres ou tokens. É rápido, mas pode cortar uma frase ao meio.
chunks = [text[i:i+500] for i in range(0, len(text), 500)]Segmentos sobrepostos
Para evitar separar uma ideia, permita que os segmentos tenham uma sobreposição. Repetir as últimas linhas mantém o contexto fluindo entre os limites.
Divisão por estrutura
Divisores mais inteligentes separam primeiro por parágrafos ou títulos. Respeitar a estrutura mantém cada segmento concentrado em um único tópico claro.
Do texto aos vetores
A pesquisa precisa de números, não de palavras. Uma incorporação transforma cada segmento em um vetor denso que captura seu significado.
O significado está na distância
As incorporações posicionam textos semelhantes próximos uns dos outros. Dois segmentos sobre a mesma ideia ficam próximos no espaço vetorial.
Chamando um modelo de incorporação
Você passa o texto para um modelo de incorporação e recebe uma lista de números de ponto flutuante. O mesmo modelo deve codificar tanto os segmentos quanto as consultas.
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")Codificando seus segmentos
Execute cada segmento no modelo para criar seu vetor. Uma única chamada pode encode a lista inteira de uma vez, com mais rapidez.
vectors = model.encode(chunks)Dimensões dos vetores
Cada vetor tem um comprimento fixo, sua dimensão. Um modelo pequeno pode fornecer 384 números; modelos maiores fornecem 768 ou mais.
print(vectors.shape) # (n_chunks, 384)Armazene o segmento e o vetor juntos
Mantenha cada vetor associado ao seu texto original e à sua fonte. Mais tarde, você recuperará pelo vetor, mas exibirá o segmento legível por humanos.
Verificação rápida
Pense por que adicionamos sobreposição ao dividir documentos.
Recapitulação
Você divide os documentos em segmentos, opcionalmente sobrepostos, e depois transforma cada um em um vetor. Armazene o texto e o vetor juntos para a recuperação. ✅
Aprenda Python com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 30
- Aulas
- 120
Perguntas Frequentes
A aula “Dividindo e gerando embeddings de documentos” é grátis?
Sim — o texto completo de “Dividindo e gerando embeddings de documentos” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Dividindo e gerando embeddings de documentos”?
Prepare uma base de conhecimento pesquisável. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Dividindo e gerando embeddings de documentos”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Por que LLMs precisam de recuperação
- Dividindo e gerando embeddings de documentos
- Busca vetorial com um armazenamento vetorial
- Integrando a recuperação ao prompt