0Pricing
AI Agents · Lección

Qué son los embeddings (representaciones vectoriales)

Un embedding es una lista de números que representa el significado de un texto; los textos similares tienen vectores similares.

Qué son los embeddings (representaciones vectoriales) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Del texto a los números

Un embedding es una lista de números (un vector) que representa el significado de un fragmento de texto. Los textos con un significado similar tienen vectores cercanos entre sí en el espacio vectorial.

¿Por qué los vectores?

Los ordenadores no pueden hacer operaciones matemáticas con palabras, pero sí con números. Los embeddings asignan a cada texto una ubicación en un espacio de muchas dimensiones, lo que nos permite:

  • Medir la similitud entre textos
  • Agrupar elementos relacionados
  • Hacer búsquedas semánticas (no solo por palabras clave)

Un ejemplo de embedding

El modelo text-embedding-3-small de OpenAI devuelve 1536 números por texto. Para "hello world", obtendría algo parecido a esto:

embedding = [0.0123, -0.0456, 0.0789, 0.0234, -0.0567, 0.0089, -0.0321]
# Real embeddings have ~1536 floats, each between roughly -1 and 1; this is a shortened example.
print("Example embedding (7 of ~1536 dimensions shown):", embedding)

Textos similares, vectores similares

Las parejas siguientes obtienen vectores cercanos:

  • "king" y "queen"
  • "happy" y "joyful"
  • "car" y "automobile"

Los vectores de la pareja "king" y "pizza" están muy alejados.

Dimensionalidad

Más dimensiones = más matices, pero también más almacenamiento. Tamaños habituales:

  • OpenAI text-embedding-3-small: 1536
  • OpenAI text-embedding-3-large: 3072
  • Cohere embed-multilingual-v3: 1024
  • BGE-small (OSS): 384

Semántica frente a léxica

La búsqueda léxica (Elasticsearch, BM25) coincide con palabras clave. La búsqueda semántica (embeddings) coincide con el significado.

"How to fix my car?" coincide semánticamente con "auto repair tips", aunque no compartan ninguna palabra.

Embeddings para documentos

Puede generar embeddings de:

  • Consultas breves
  • Oraciones
  • Párrafos (unos 500 tokens es el punto óptimo)
  • Documentos completos (con pérdida de calidad)

Embeddings para código

Existen modelos de embedding específicos para código (por ejemplo, Voyage Code y Jina Code) que entienden la sintaxis de programación y superan a los embeddings de texto generales en las búsquedas de código.

Embeddings multimodales

Puede generar embeddings de imágenes, audio y vídeo en el mismo espacio que el texto, lo que permite realizar búsquedas entre distintas modalidades. CLIP es el ejemplo más conocido para imágenes.

Sesgo en los embeddings

Los embeddings reflejan sus datos de entrenamiento. Codifican sesgos: asociaciones entre género y profesión, estereotipos raciales, etc. Téngalo en cuenta al usarlos para tomar decisiones de clasificación relacionadas con personas.

Lo que los embeddings no pueden hacer

  • No pueden resolver problemas matemáticos
  • No pueden hacer inferencias lógicas
  • No pueden generar texto
  • No pueden razonar sobre causa y efecto

Sirven para MEDIR la similitud, no para RAZONAR.

Definición de embedding

¿Qué es un embedding?

Recapitulación

Los embeddings convierten el texto en vectores. Los vectores permiten realizar búsquedas semánticas, agrupaciones y RAG. A continuación, los generaremos con la API de OpenAI.

Preguntas frecuentes

¿La lección «Qué son los embeddings (representaciones vectoriales)» es gratis?

Sí — el texto completo de «Qué son los embeddings (representaciones vectoriales)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Qué son los embeddings (representaciones vectoriales)»?

Un embedding es una lista de números que representa el significado de un texto; los textos similares tienen vectores similares. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «Qué son los embeddings (representaciones vectoriales)»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Qué son los embeddings (representaciones vectoriales)
  2. Generar embeddings con text-embedding-3
  3. Similitud coseno para la recuperación
  4. Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)
← Volver a AI Agents