NLP Academy · Lección

Fragmentación y generación de embeddings de documentos

Preparar una base de conocimiento consultable

Lección 2 de 413 pasos

Fragmentación y generación de embeddings de documentos es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

Los documentos son demasiado grandes para buscarlos completos

Un PDF extenso puede contener muchos temas a la vez. Para recuperar información con precisión, primero debe dividirlo en piezas más pequeñas llamadas chunks.

Qué hace que un chunk sea bueno

Un buen chunk contiene una idea coherente: uno o dos párrafos. Si es demasiado grande, oculta la respuesta; si es demasiado pequeño, pierde el contexto circundante.

División por tamaño

El método más sencillo corta el texto cada cierto número fijo de caracteres o tokens. Es rápido, pero puede partir una oración por la mitad.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Chunks superpuestos

Para evitar separar una idea, haga que los chunks compartan una superposición. Repetir las últimas líneas mantiene la continuidad del contexto entre los límites.

División según la estructura

Los divisores más inteligentes separan primero por párrafos o encabezados. Respetar la estructura mantiene cada chunk centrado en un único tema claro.

Del texto a los vectores

La búsqueda necesita números, no palabras. Un embedding convierte cada chunk en un vector denso que captura su significado.

El significado reside en la distancia

Los embeddings colocan cerca los textos similares. Dos chunks sobre la misma idea quedan próximos en el espacio vectorial.

Cómo invocar un modelo de embeddings

Se pasa el texto a un modelo de embeddings y se obtiene una lista de valores float. El mismo modelo debe codificar tanto los chunks como las consultas.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Codificación de sus chunks

Ejecute cada chunk mediante el modelo para crear su vector. Una sola llamada puede codificar toda la lista a la vez para ganar velocidad.

vectors = model.encode(chunks)

Dimensiones de los vectores

Cada vector tiene una longitud fija: su dimensión. Un modelo pequeño puede generar 384 números; los más grandes generan 768 o más.

print(vectors.shape)  # (n_chunks, 384)

Almacene juntos el chunk y el vector

Mantenga cada vector vinculado a su texto original y a su fuente. Después recuperará mediante el vector, pero mostrará el chunk legible para las personas.

Comprobación rápida

Considere por qué añadimos superposición al dividir documentos.

Resumen

Divide los documentos en chunks, opcionalmente superpuestos, y después incorpora cada uno a un vector. Almacene juntos el texto y el vector para la recuperación. ✅

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Fragmentación y generación de embeddings de documentos» es gratis?

Sí — el texto completo de «Fragmentación y generación de embeddings de documentos» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Fragmentación y generación de embeddings de documentos»?

Preparar una base de conocimiento consultable Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Fragmentación y generación de embeddings de documentos»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Por qué los LLM necesitan retrieval
  2. Fragmentación y generación de embeddings de documentos
  3. Búsqueda vectorial con un vector store
  4. Integración del retrieval en el prompt
← Volver a NLP Academy