0Pricing
Learn AI with Python · Lección

Tokenización y normalización

Técnicas de preprocesamiento de texto.

Tokenización y normalización es una lección gratuita de Learn AI with Python en CoddyKit. Esta es la lección 2 de 5. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Learn AI with Python, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Learn AI with Python incluye 5 lecciones en total.

Conceptos básicos del preprocesamiento de texto

Tokenización y normalización

El preprocesamiento de texto es un paso fundamental del NLP. Consiste en transformar texto sin procesar a un formato estructurado para su análisis. Entre los pasos clave del preprocesamiento se incluyen la tokenización y la normalización.

Tokenización y normalización — ilustración 1

¿Qué es la tokenización?

¿Qué es la tokenización?

La tokenización es el proceso de dividir el texto en unidades más pequeñas llamadas tokens. Los tokens pueden ser palabras, oraciones o caracteres.

Por ejemplo:

Texto: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Ejemplo de tokenización en Python

Ejemplo de tokenización en Python

Con la biblioteca NLTK, podemos tokenizar el texto en palabras u oraciones:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

¿Qué es la normalización?

¿Qué es la normalización?

La normalización consiste en limpiar y estandarizar el texto. Entre las técnicas habituales de normalización se incluyen:

  • Conversión a minúsculas: Convertir todo el texto a minúsculas.
  • Eliminación de la puntuación: Eliminar los signos de puntuación.
  • Stemming: Reducir las palabras a su raíz eliminando sufijos (por ejemplo, "running" → "run").
  • Lematización: Reducir las palabras a su forma base utilizando el contexto (por ejemplo, "better" → "good").

Conversión a minúsculas y eliminación de la puntuación

Conversión a minúsculas y eliminación de la puntuación

A continuación se muestra cómo normalizar el texto convirtiéndolo a minúsculas y eliminando la puntuación:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming y lematización

Stemming y lematización

Stemming: Reduce las palabras a su raíz eliminando sufijos. Se basa en reglas y no siempre produce palabras válidas.

Lematización: Utiliza un vocabulario y reglas gramaticales para reducir las palabras a su forma base con significado.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Eliminación de stopwords

Eliminación de stopwords

Las stopwords son palabras comunes (por ejemplo, "is", "and", "the") que a menudo no aportan un significado relevante. Eliminarlas puede simplificar el análisis de texto:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Desafíos del preprocesamiento de texto

Desafíos del preprocesamiento de texto

El preprocesamiento de texto puede ser complicado debido a:

  • Ambigüedad: Palabras como "lead" pueden tener varios significados.
  • Contexto: La lematización requiere comprender el contexto de la palabra.
  • Variación lingüística: Gestión de diferentes idiomas y dialectos.

Resumen y próximos pasos

Resumen y próximos pasos

En esta lección:

  • Aprendimos sobre la tokenización y la normalización.
  • Exploramos técnicas como el stemming, la lematización y la eliminación de palabras vacías.
  • Practicamos el preprocesamiento de texto con Python.

A continuación, analizaremos patrones de texto mediante modelos de N-gramas.

Tokenización y normalización — ilustración 10

Preguntas frecuentes

¿La lección «Tokenización y normalización» es gratis?

Sí — el texto completo de «Tokenización y normalización» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Learn AI with Python, actualiza a CoddyKit PRO. El curso de Learn AI with Python incluye 5 lecciones en total.

¿Qué aprenderé en «Tokenización y normalización»?

Técnicas de preprocesamiento de texto. Practicas Learn AI with Python con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Learn AI with Python?

No se requiere experiencia previa. Learn AI with Python en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 5.

¿Cuánto tiempo toma la lección «Tokenización y normalización»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Learn AI with Python?

Sí. Cada lección de Learn AI with Python incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Trabajo con datos de texto
  2. Tokenización y normalización
  3. Modelos de N-gramas
  4. Conceptos de análisis de sentimientos
  5. Modelos basados en Transformers
← Volver a Learn AI with Python