Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline
Utrwalanie modeli za pomocą joblib
Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Wystarczy jeden trening
Poświęcił(a) Pan/Pani czas na dopasowanie i dostrojenie potoku. Zapisanie go oznacza, że nie trzeba ponownie trenować modelu tylko po to, aby wykonać predykcję. 💾
Serializacja potoku za pomocą pickle
Dopasowany potok jest obiektem Pythona, więc można go serializować na dysku i przywrócić dokładnie w takim stanie, w jakim był.
Dlaczego joblib wygrywa
W przypadku obiektów scikit-learn zawierających tablice NumPy joblib jest szybszy i zajmuje mniej miejsca niż zwykły pickle, dlatego jest domyślnym wyborem.
import joblibZapisywanie jednym wywołaniem
Przekaż dopasowany potok i nazwę pliku do joblib.dump. Cały łańcuch przygotowania danych i modelu zostanie zapisany w jednym pliku.
joblib.dump(pipe, 'model.joblib')Wczytywanie potoku
Później, w dowolnym skrypcie, joblib.load odtworzy dokładnie ten sam potok, gotowy do wykonywania predykcji bez ponownego treningu.
pipe = joblib.load('model.joblib')Natychmiastowa predykcja
Wczytany obiekt nadal pamięta wyuczone skalowanie i wagi, więc można od razu wywołać predict na nowych danych.
preds = pipe.predict(new_data)Dopasuj wersje
Zapisany model może przestać działać po wczytaniu w innej wersji biblioteki. Zapisz wersję scikit-learn, z którą przeprowadzono trening.
Te same kolumny na wejściu
Nowe dane muszą zawierać te same kolumny, w tej samej kolejności co dane treningowe. Potok oczekuje dokładnie takiego schematu, aby poprawnie wykonać transformację.
Ufaj tylko własnym plikom
Wczytanie pliku pickle uruchamia kod, dlatego nigdy nie należy otwierać plików z niezaufanych źródeł. Plik modelu należy traktować jak plik wykonywalny.
Wdrażanie na produkcji
To właśnie ten jeden plik wczytuje aplikacja internetowa lub zadanie wsadowe, aby wykonywać predykcje. Zapisanie całego potoku upraszcza wdrażanie.
Jeden pakiet, żadnych niespodzianek
Ponieważ przygotowanie danych jest przechowywane razem z modelem, wdrożony potok przekształca dane wejściowe tak samo jak podczas treningu. Bez dryfu i bez niezgodności.
Szybkie sprawdzenie
Jakie narzędzie jest zalecane do zapisywania dopasowanego potoku scikit-learn na dysku?
Podsumowanie
Może Pan/Pani zapisać wytrenowany potok za pomocą joblib, a następnie wczytać go w dowolnym miejscu i od razu wykonywać predykcje. To kończy omówienie potoków od początku do końca. 🎉
Często zadawane pytania
Czy lekcja „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline” jest bezpłatna?
Tak — pełny tekst „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline”?
Utrwalanie modeli za pomocą joblib Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?
Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?
Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego Pipeline przewyższa ręczne kroki
- ColumnTransformer dla mieszanych typów
- Dostrajanie za pomocą GridSearchCV
- Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline