0Pricing
Data Science Academy · Lekcja

Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline

Utrwalanie modeli za pomocą joblib

Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Wystarczy jeden trening

Poświęcił(a) Pan/Pani czas na dopasowanie i dostrojenie potoku. Zapisanie go oznacza, że nie trzeba ponownie trenować modelu tylko po to, aby wykonać predykcję. 💾

Serializacja potoku za pomocą pickle

Dopasowany potok jest obiektem Pythona, więc można go serializować na dysku i przywrócić dokładnie w takim stanie, w jakim był.

Dlaczego joblib wygrywa

W przypadku obiektów scikit-learn zawierających tablice NumPy joblib jest szybszy i zajmuje mniej miejsca niż zwykły pickle, dlatego jest domyślnym wyborem.

import joblib

Zapisywanie jednym wywołaniem

Przekaż dopasowany potok i nazwę pliku do joblib.dump. Cały łańcuch przygotowania danych i modelu zostanie zapisany w jednym pliku.

joblib.dump(pipe, 'model.joblib')

Wczytywanie potoku

Później, w dowolnym skrypcie, joblib.load odtworzy dokładnie ten sam potok, gotowy do wykonywania predykcji bez ponownego treningu.

pipe = joblib.load('model.joblib')

Natychmiastowa predykcja

Wczytany obiekt nadal pamięta wyuczone skalowanie i wagi, więc można od razu wywołać predict na nowych danych.

preds = pipe.predict(new_data)

Dopasuj wersje

Zapisany model może przestać działać po wczytaniu w innej wersji biblioteki. Zapisz wersję scikit-learn, z którą przeprowadzono trening.

Te same kolumny na wejściu

Nowe dane muszą zawierać te same kolumny, w tej samej kolejności co dane treningowe. Potok oczekuje dokładnie takiego schematu, aby poprawnie wykonać transformację.

Ufaj tylko własnym plikom

Wczytanie pliku pickle uruchamia kod, dlatego nigdy nie należy otwierać plików z niezaufanych źródeł. Plik modelu należy traktować jak plik wykonywalny.

Wdrażanie na produkcji

To właśnie ten jeden plik wczytuje aplikacja internetowa lub zadanie wsadowe, aby wykonywać predykcje. Zapisanie całego potoku upraszcza wdrażanie.

Jeden pakiet, żadnych niespodzianek

Ponieważ przygotowanie danych jest przechowywane razem z modelem, wdrożony potok przekształca dane wejściowe tak samo jak podczas treningu. Bez dryfu i bez niezgodności.

Szybkie sprawdzenie

Jakie narzędzie jest zalecane do zapisywania dopasowanego potoku scikit-learn na dysku?

Podsumowanie

Może Pan/Pani zapisać wytrenowany potok za pomocą joblib, a następnie wczytać go w dowolnym miejscu i od razu wykonywać predykcje. To kończy omówienie potoków od początku do końca. 🎉

Często zadawane pytania

Czy lekcja „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline” jest bezpłatna?

Tak — pełny tekst „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline”?

Utrwalanie modeli za pomocą joblib Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?

Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?

Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego Pipeline przewyższa ręczne kroki
  2. ColumnTransformer dla mieszanych typów
  3. Dostrajanie za pomocą GridSearchCV
  4. Zapisywanie i ponowne wczytywanie wytrenowanego Pipeline
← Powrót do Data Science Academy