Canalizaciones de scikit-learn de principio a fin
Encadenar el vectorizador y el modelo de forma ordenada
Canalizaciones de scikit-learn de principio a fin es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.
¿Qué es un pipeline?
Un pipeline encadena sus pasos en un solo objeto: limpiar, vectorizar y clasificar. Llámelo una vez y cada paso se ejecutará en el orden correcto. 🔗
Por qué conviene unir los pasos
Vectorizar y entrenar manualmente puede provocar errores. Un pipeline mantiene los pasos unidos para que nunca pierdan la sincronización.
Importar los componentes
Necesita un vectorizador y un clasificador. Importe la clase Pipeline y los dos componentes que quiera encadenar.
from sklearn.pipeline import Pipeline
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegressionConstruir el pipeline
Enumere sus pasos como pares con nombre. El primero transforma el texto en características y el último realiza la predicción.
pipe = Pipeline([
("tfidf", TfidfVectorizer()),
("clf", LogisticRegression())
])Ajustar con texto sin procesar
Llame a fit con el texto sin procesar y las etiquetas. El pipeline vectoriza y entrena en una sola línea, sin pasos manuales.
pipe.fit(X_train, y_train)Predecir con una sola llamada
Para clasificar texto nuevo, llame a predict. El mismo vectorizador se reutiliza automáticamente, por lo que el entrenamiento y la prueba mantienen una coherencia total.
preds = pipe.predict(X_test)Sin fuga de datos
Los pipelines aprenden el vocabulario únicamente a partir de los datos de entrenamiento. Esto evita la fuga de datos, que ocurre cuando información de prueba se filtra al entrenamiento y aumenta artificialmente su puntuación.
Evaluar el pipeline
Use score para obtener la precisión con datos reservados en una sola llamada. El pipeline se encarga de vectorizar el texto de prueba.
acc = pipe.score(X_test, y_test)
print(acc)Ajustar toda la cadena
La búsqueda en cuadrícula puede ajustar cualquier paso. Especifique los parámetros con el nombre del paso seguido de dos guiones bajos para acceder al interior de un componente.
params = {"tfidf__ngram_range": [(1,1), (1,2)],
"clf__C": [0.1, 1, 10]}Validar de forma segura
Pase todo el pipeline a la validación cruzada. En cada partición se vuelve a ajustar el vectorizador, por lo que cada puntuación refleja datos realmente no vistos.
from sklearn.model_selection import cross_val_score
scores = cross_val_score(pipe, X, y, cv=5)Un solo objeto para distribuir
Lo mejor es que un pipeline ajustado es un único objeto. Guárdelo y cárguelo como una unidad, y la inferencia coincidirá exactamente con el entrenamiento.
Comprobación rápida
Reflexione sobre la principal ventaja de seguridad que le ofrece un pipeline.
Resumen
Ha unido un vectorizador y un clasificador en un solo pipeline, lo ha ajustado con texto sin procesar, ha predicho en una línea, ha ajustado la cadena y ha evitado la fuga de datos. 🎉
Aprende Python con un tutor de IA — gratis
Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.
- Cursos
- 30
- Lecciones
- 120
Preguntas frecuentes
¿La lección «Canalizaciones de scikit-learn de principio a fin» es gratis?
Sí — el texto completo de «Canalizaciones de scikit-learn de principio a fin» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Canalizaciones de scikit-learn de principio a fin»?
Encadenar el vectorizador y el modelo de forma ordenada Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar NLP Academy?
No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.
¿Cuánto tiempo toma la lección «Canalizaciones de scikit-learn de principio a fin»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de NLP Academy?
Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Estructuración de un proyecto real de NLP
- Canalizaciones de scikit-learn de principio a fin
- Guardado y carga de su modelo
- Predicción sobre texto completamente nuevo