0Pricing
NLP Academy · Lección

Generación de embeddings de oraciones con BERT

Extraer vectores contextuales mediante código

Generación de embeddings de oraciones con BERT es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

From Words to Sentences

BERT gives every token its own vector. But often you want one vector for the whole sentence, not each word.

The CLS Token

BERT adds a special token named CLS at the very front of each input. Its output is often used as a sentence summary.

Mean Pooling

Another common trick averages all the token vectors into one. This mean pooling step often beats the raw CLS vector.

Load a Model

Hugging Face makes loading easy: grab a tokenizer and a model with one line each. They form your pipeline for embeddings.

from transformers import AutoTokenizer, AutoModel
tok = AutoTokenizer.from_pretrained("bert-base-uncased")
model = AutoModel.from_pretrained("bert-base-uncased")

Tokenize the Text

The tokenizer turns your sentence into id numbers and an attention mask BERT understands. This is the encoding step.

inputs = tok("I love NLP", return_tensors="pt")

Run the Model

Pass the encoded inputs into BERT to get hidden states for every token. These vectors are the raw output you will pool.

out = model(**inputs)
states = out.last_hidden_state

Pool to One Vector

Average the token states along the sequence to collapse them into a single sentence embedding you can store.

vec = states.mean(dim=1)

An Easier Path

The Sentence-Transformers library wraps all of this for you. One call returns a clean sentence vector ready to use. ✨

from sentence_transformers import SentenceTransformer
m = SentenceTransformer("all-MiniLM-L6-v2")
vec = m.encode("I love NLP")

Compare Sentences

With two sentence vectors you measure closeness using cosine similarity. Higher scores mean the sentences mean similar things.

What You Can Build

Sentence embeddings power semantic search, clustering, and duplicate detection. They turn meaning into something you can search.

A Note on Quality

Models tuned for sentences, like MiniLM, usually beat plain BERT here. Pick one trained for the task you actually have.

Quick Check

How do you turn many token vectors into one sentence vector?

Recap

Tokenize, run BERT, then pool or use CLS to get one sentence embedding. Sentence-Transformers makes it a single call. ✅

Preguntas frecuentes

¿La lección «Generación de embeddings de oraciones con BERT» es gratis?

Sí — el texto completo de «Generación de embeddings de oraciones con BERT» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Generación de embeddings de oraciones con BERT»?

Extraer vectores contextuales mediante código Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Generación de embeddings de oraciones con BERT»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Por qué el contexto cambia el significado de una palabra
  2. Modelado de lenguaje enmascarado
  3. Generación de embeddings de oraciones con BERT
  4. Elección del modelo preentrenado adecuado
← Volver a NLP Academy