0Pricing
NLP Academy · Lección

Tokenización para modelos Transformer

Subpalabras, padding y máscaras de atención

Tokenización para modelos Transformer es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

Los tokens van primero

Antes de que un transformer pueda aprender algo, el texto debe convertirse en números. Esa tarea corresponde al tokenizador.

Haga coincidir el modelo

Cargue siempre el tokenizador con el que se entrenó su modelo. Un vocabulario incompatible produce identificadores inservibles que el modelo nunca ha visto.

from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")

Fragmentos de subpalabras

Los tokenizadores modernos dividen las palabras poco frecuentes en fragmentos más pequeños llamados subpalabras, de modo que incluso el texto desconocido puede representarse.

print(tok.tokenize("tokenization"))

Por qué ganan las subpalabras

Las subpalabras mantienen pequeño el vocabulario y, al mismo tiempo, permiten gestionar errores tipográficos y palabras nuevas. El modelo rara vez encuentra un token realmente desconocido.

De tokens a identificadores

Cada subpalabra se asigna a un identificador entero. Al llamar al tokenizador con un texto, obtiene esos identificadores listos para el modelo.

enc = tok("Fine-tuning is fun")
print(enc["input_ids"])

Tokens especiales

Los tokenizadores añaden marcadores como CLS y SEP para que el modelo sepa dónde comienza y termina una secuencia. Estos son los tokens especiales.

Relleno hasta la misma longitud

Los lotes necesitan filas de la misma longitud, así que los textos más cortos reciben tokens de relleno. Este paso se llama padding.

tok(texts, padding=True)

Truncamiento para textos largos

Los modelos limitan la longitud de entrada, por lo que el texto muy largo se recorta para que quepa. Activar el truncation mantiene cada ejemplo dentro del límite.

tok(texts, truncation=True, max_length=128)

La máscara de atención

Una máscara de atención marca los tokens reales con 1 y el relleno con 0, para que el modelo ignore las posiciones de relleno.

print(enc["attention_mask"])

Devuelva tensores

Solicite al tokenizador directamente los tensores del framework para que la salida pase directamente al entrenamiento sin necesidad de una conversión adicional.

tok("hello", return_tensors="pt")

Vuelva a decodificar el texto

Para leer las predicciones, pase los identificadores a decode y el tokenizador reconstruirá el texto original, sin los tokens especiales.

print(tok.decode(enc["input_ids"]))

Comprobación rápida

¿Qué función cumple la máscara de atención durante la creación de lotes?

Resumen

Los tokenizadores convierten el texto en identificadores de subpalabras, añaden tokens especiales y gestionan el padding, el truncamiento y la máscara de atención para crear lotes uniformes. ✅

Preguntas frecuentes

¿La lección «Tokenización para modelos Transformer» es gratis?

Sí — el texto completo de «Tokenización para modelos Transformer» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Tokenización para modelos Transformer»?

Subpalabras, padding y máscaras de atención Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Tokenización para modelos Transformer»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Recorrido por la biblioteca Transformers
  2. Tokenización para modelos Transformer
  3. Fine-tuning con la API Trainer
  4. Evaluación y guardado de su modelo
← Volver a NLP Academy