0Pricing
AI Agents · Lección

Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)

Compare OpenAI, Cohere Embed y BGE/E5 de código abierto: dimensiones, coste y puntuaciones de MTEB.

Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

¿Por qué comparar?

OpenAI no es la única opción disponible. Cohere, Voyage, Google y muchos modelos OSS ofrecen embeddings competitivos, a veces más baratos, con mayor compatibilidad multilingüe o especializados en código.

La elección adecuada depende del caso de uso.

OpenAI text-embedding-3

La opción predeterminada para la mayoría de los equipos:

  • + Gran calidad en inglés
  • + Económico (0,02 $ / 1M de tokens para el modelo small)
  • + Hasta 3072 dimensiones con Matryoshka
  • - Solo disponible en la nube

Cohere Embed

El modelo embed-multilingual-v3 de Cohere es la opción multilingüe más sólida:

  • + Excelente compatibilidad multilingüe (más de 100 idiomas)
  • + Modos separados para consultas y documentos
  • - Ligeramente más caro

Embeddings de Voyage

Recomendados por Anthropic; modelos especializados sólidos:

  • + voyage-3: el mejor para uso general
  • + voyage-code-3: el mejor para código
  • + voyage-finance / law: ajustados a dominios específicos

BGE (BAAI General Embedding)

La principal familia de código abierto de BAAI:

  • + Gratis, se ejecuta en CPU o en una GPU pequeña
  • + bge-large-en, bge-m3 (multilingüe)
  • - Ligeramente por detrás de los modelos cerrados en MTEB

E5 (Microsoft)

La familia e5-large de Microsoft. Un competidor sólido de código abierto, popular en los benchmarks de investigación.

Elegir según el benchmark

MTEB (Massive Text Embedding Benchmark) es la clasificación de referencia: huggingface.co/spaces/mteb/leaderboard

Filtre según su tarea (recuperación, clasificación o agrupación) y su idioma.

Elegir según el coste

Para 1M de documentos (~500M de tokens):

  • text-embedding-3-small: ~10 $
  • text-embedding-3-large: ~65 $
  • Cohere v3: ~50 $
  • BGE local en una GPU: ~5 $ (electricidad)

Elegir según la privacidad

Si no puede enviar datos a OpenAI:

  • Autoaloje BGE / E5 con sentence-transformers
  • Use Cohere mediante AWS Bedrock (compromisos de residencia de datos)
  • Use OpenAI mediante Azure (de forma similar)

Elegir según el idioma

Para contenido que no esté en inglés:

  • Cohere multilingual v3: la compatibilidad más amplia
  • bge-m3: sólido modelo multilingüe OSS
  • OpenAI text-embedding-3: sorprendentemente bueno, pero orientado principalmente al inglés

Modelos específicos del dominio

Para código: voyage-code-3 o jina-embeddings-v2-base-code

Para finanzas o asuntos legales: voyage-finance, voyage-law

Para ciencia: SPECTER, SciNCL

Mezclar modelos

NO mezcle vectores de modelos diferentes en el mismo índice: no son comparables. Si cambia de modelo, vuelva a generar los embeddings de todo con un único modelo.

Probar dos modelos con A/B

La forma adecuada de elegir:

  1. Construya un conjunto de evaluación pequeño con pares de (consulta, documentos esperados)
  2. Genere los embeddings de su corpus con ambos modelos
  3. Mida recall@10 en el conjunto de evaluación
  4. Elija el ganador

Mezclar modelos

¿Se pueden mezclar embeddings de dos modelos diferentes en un mismo índice?

Resumen

Use text-embedding-3-small como opción predeterminada; explore Cohere para contenido multilingüe, Voyage para código y dominios específicos, y BGE para autoalojamiento. Realice siempre benchmarks con sus propios datos.

Preguntas frecuentes

¿La lección «Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)» es gratis?

Sí — el texto completo de «Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)»?

Compare OpenAI, Cohere Embed y BGE/E5 de código abierto: dimensiones, coste y puntuaciones de MTEB. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Qué son los embeddings (representaciones vectoriales)
  2. Generar embeddings con text-embedding-3
  3. Similitud coseno para la recuperación
  4. Comparación de modelos de embeddings (OpenAI frente a Cohere y OSS)
← Volver a AI Agents