Tokenización y normalización
Técnicas de preprocesamiento de texto
Tokenización y normalización es una lección gratuita de Python Academy en CoddyKit. Esta es la lección 2 de 5. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Python Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Python Academy incluye 5 lecciones en total.
Fundamentos del preprocesamiento de texto
Tokenización y normalización
El preprocesamiento de texto es un paso fundamental en NLP. Consiste en transformar texto sin procesar a un formato estructurado para su análisis. Entre los pasos clave del preprocesamiento se incluyen la tokenización y la normalización.

¿Qué es la tokenización?
¿Qué es la tokenización?
La tokenización es el proceso de dividir el texto en unidades más pequeñas, llamadas tokens. Los tokens pueden ser palabras, oraciones o caracteres.
Por ejemplo:
Texto: "NLP is amazing!"
Tokens: ["NLP", "is", "amazing", "!"]
Ejemplo de tokenización en Python
Ejemplo de tokenización en Python
Con la biblioteca NLTK, podemos tokenizar el texto en palabras u oraciones:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)¿Qué es la normalización?
¿Qué es la normalización?
La normalización consiste en limpiar y estandarizar el texto. Entre las técnicas habituales de normalización se incluyen:
- Conversión a minúsculas: Convertir todo el texto a minúsculas.
- Eliminación de signos de puntuación: Eliminar los signos de puntuación.
- Stemming: Reducir las palabras a su raíz (por ejemplo, "corriendo" → "corr").
- Lematización: Reducir las palabras a su forma base utilizando el contexto (por ejemplo, "mejor" → "bueno").
Conversión a minúsculas y eliminación de signos de puntuación
Conversión a minúsculas y eliminación de signos de puntuación
Así se normaliza el texto convirtiéndolo a minúsculas y eliminando los signos de puntuación:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Stemming y lematización
Stemming y lematización
Stemming: Reduce las palabras a su raíz eliminando los sufijos. Se basa en reglas y no siempre produce palabras válidas.
Lematización: Utiliza un vocabulario y reglas gramaticales para reducir las palabras a su forma base con significado.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Eliminación de palabras vacías
Eliminación de palabras vacías
Las palabras vacías son palabras comunes (por ejemplo, "es", "y", "el") que a menudo no aportan un significado importante. Eliminarlas puede simplificar el análisis de texto:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Desafíos del preprocesamiento de texto
Desafíos del preprocesamiento de texto
El preprocesamiento de texto puede ser difícil debido a:
- Ambigüedad: Palabras como "banco" pueden tener varios significados.
- Contexto: La lematización requiere comprender el contexto de la palabra.
- Variación lingüística: Trabajar con diferentes idiomas y dialectos.
Resumen y próximos pasos
Resumen y próximos pasos
En esta lección:
- Aprendimos sobre la tokenización y la normalización.
- Exploramos técnicas como el stemming, la lematización y la eliminación de palabras vacías.
- Practicamos el preprocesamiento de texto con Python.
A continuación, analizaremos patrones de texto mediante modelos de n-gramas.

Preguntas frecuentes
¿La lección «Tokenización y normalización» es gratis?
Sí — el texto completo de «Tokenización y normalización» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Python Academy, actualiza a CoddyKit PRO. El curso de Python Academy incluye 5 lecciones en total.
¿Qué aprenderé en «Tokenización y normalización»?
Técnicas de preprocesamiento de texto Practicas Python Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Python Academy?
No se requiere experiencia previa. Python Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 5.
¿Cuánto tiempo toma la lección «Tokenización y normalización»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Python Academy?
Sí. Cada lección de Python Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Trabajo con datos de texto
- Tokenización y normalización
- Modelos de N-gramas
- Conceptos de análisis de sentimientos
- Modelos basados en transformers