NLP Academy · Lección

Canalizaciones de scikit-learn de principio a fin

Encadenar el vectorizador y el modelo de forma ordenada

Lección 2 de 413 pasos

Canalizaciones de scikit-learn de principio a fin es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué es un pipeline?

Un pipeline encadena sus pasos en un solo objeto: limpiar, vectorizar y clasificar. Llámelo una vez y cada paso se ejecutará en el orden correcto. 🔗

Por qué conviene unir los pasos

Vectorizar y entrenar manualmente puede provocar errores. Un pipeline mantiene los pasos unidos para que nunca pierdan la sincronización.

Importar los componentes

Necesita un vectorizador y un clasificador. Importe la clase Pipeline y los dos componentes que quiera encadenar.

from sklearn.pipeline import Pipeline
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression

Construir el pipeline

Enumere sus pasos como pares con nombre. El primero transforma el texto en características y el último realiza la predicción.

pipe = Pipeline([
    ("tfidf", TfidfVectorizer()),
    ("clf", LogisticRegression())
])

Ajustar con texto sin procesar

Llame a fit con el texto sin procesar y las etiquetas. El pipeline vectoriza y entrena en una sola línea, sin pasos manuales.

pipe.fit(X_train, y_train)

Predecir con una sola llamada

Para clasificar texto nuevo, llame a predict. El mismo vectorizador se reutiliza automáticamente, por lo que el entrenamiento y la prueba mantienen una coherencia total.

preds = pipe.predict(X_test)

Sin fuga de datos

Los pipelines aprenden el vocabulario únicamente a partir de los datos de entrenamiento. Esto evita la fuga de datos, que ocurre cuando información de prueba se filtra al entrenamiento y aumenta artificialmente su puntuación.

Evaluar el pipeline

Use score para obtener la precisión con datos reservados en una sola llamada. El pipeline se encarga de vectorizar el texto de prueba.

acc = pipe.score(X_test, y_test)
print(acc)

Ajustar toda la cadena

La búsqueda en cuadrícula puede ajustar cualquier paso. Especifique los parámetros con el nombre del paso seguido de dos guiones bajos para acceder al interior de un componente.

params = {"tfidf__ngram_range": [(1,1), (1,2)],
          "clf__C": [0.1, 1, 10]}

Validar de forma segura

Pase todo el pipeline a la validación cruzada. En cada partición se vuelve a ajustar el vectorizador, por lo que cada puntuación refleja datos realmente no vistos.

from sklearn.model_selection import cross_val_score
scores = cross_val_score(pipe, X, y, cv=5)

Un solo objeto para distribuir

Lo mejor es que un pipeline ajustado es un único objeto. Guárdelo y cárguelo como una unidad, y la inferencia coincidirá exactamente con el entrenamiento.

Comprobación rápida

Reflexione sobre la principal ventaja de seguridad que le ofrece un pipeline.

Resumen

Ha unido un vectorizador y un clasificador en un solo pipeline, lo ha ajustado con texto sin procesar, ha predicho en una línea, ha ajustado la cadena y ha evitado la fuga de datos. 🎉

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Canalizaciones de scikit-learn de principio a fin» es gratis?

Sí — el texto completo de «Canalizaciones de scikit-learn de principio a fin» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Canalizaciones de scikit-learn de principio a fin»?

Encadenar el vectorizador y el modelo de forma ordenada Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Canalizaciones de scikit-learn de principio a fin»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Estructuración de un proyecto real de NLP
  2. Canalizaciones de scikit-learn de principio a fin
  3. Guardado y carga de su modelo
  4. Predicción sobre texto completamente nuevo
← Volver a NLP Academy