0Pricing
Learn AI with Python · Lekcja

Obserwowalność i monitorowanie systemów AI

Panele wydajności modeli, alerty dotyczące dryfu danych, pętle informacji zwrotnej, wdrażanie w trybie shadow.

Obserwowalność i monitorowanie systemów AI to bezpłatna lekcja Learn AI with Python na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Learn AI with Python, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Learn AI with Python zawiera 4 lekcji w sumie.

Dlaczego monitorować systemy ML

Wdrożony model nie oznacza końca pracy. Ruch może gwałtownie wzrosnąć, opóźnienie może się zwiększyć, a świat może się zmienić, powodując odejście danych od danych treningowych. Obserwowalność informuje, czy system działa prawidłowo i czy model nadal jest dokładny, zanim użytkownicy odczują problemy.

Dwa rodzaje monitorowania

Obserwowalność ML obejmuje dwie warstwy:

  • Operacyjną: opóźnienie, przepustowość, błędy i wykorzystanie zasobów (jak w przypadku każdej usługi)
  • Modelu: dryf danych, rozkład predykcji oraz dokładność w czasie (elementy charakterystyczne dla ML)

Prometheus do metryk

Prometheus to standardowy system do gromadzenia metryk szeregów czasowych. Usługa udostępnia punkt końcowy metryk, a Prometheus cyklicznie je pobiera i zapisuje wartości na potrzeby zapytań oraz alertów.

Instrumentowanie opóźnienia

Opóźnienie wnioskowania rejestruje się za pomocą histogramu Prometheus. Histogramy umożliwiają obliczanie percentyli, które są właściwym sposobem podsumowywania opóźnienia, zamiast wprowadzającej w błąd średniej.

from prometheus_client import Histogram

INFER_LATENCY = Histogram(
    "inference_latency_seconds",
    "Model inference latency",
)

@INFER_LATENCY.time()
def predict(x):
    return model(x)

Opóźnienie P50 i P95

Opóźnienie należy przedstawiać jako percentyle. P50 (mediana) opisuje typowe doświadczenie użytkownika, a P95 oznacza wolny ogon — opóźnienie przekraczane przez 5% żądań. Obserwowanie P95 pozwala wykrywać problemy ukrywane przez średnią, ponieważ nawet kilka powolnych żądań pogarsza doświadczenie użytkowników.

Panele Grafana

Grafana wizualizuje metryki Prometheus na żywo w panelach. Panel modelu zazwyczaj pokazuje na jednym ekranie liczbę żądań, odsetek błędów, opóźnienie P50/P95 oraz rozkład predykcji, umożliwiając szybką ocenę stanu systemu.

Czym jest dryf danych

Dryf danych występuje, gdy rozkład danych wejściowych w środowisku produkcyjnym zaczyna odbiegać od rozkładu danych treningowych. Model dopasowano do dawnych wzorców, dlatego wraz z dryfem danych jego dokładność stopniowo spada, mimo że nie zmieniono żadnego kodu.

Wskaźnik stabilności populacji

Wskaźnik stabilności populacji (Population Stability Index, PSI) określa skalę dryfu, porównując bieżący rozkład cechy z jej rozkładem podczas trenowania. Oba rozkłady dzieli się na przedziały, a następnie sumuje ważone logarytmiczne ilorazy dla poszczególnych przedziałów.

# PSI = sum over bins of
#   (actual_pct - expected_pct) * ln(actual_pct / expected_pct)

Interpretacja PSI

Konwencjonalne progi PSI:

  • PSI < 0.1: brak istotnego dryfu
  • od 0.1 do 0.2: umiarkowany dryf, wymaga analizy
  • PSI > 0.2: istotny dryf, model prawdopodobnie wymaga ponownego trenowania

Alarmowanie po przekroczeniu przez PSI wartości 0.2 jest powszechną praktyką.

Pętla sprzężenia zwrotnego

Najcenniejszym sygnałem monitorowania są rzeczywiste wyniki. Pętla sprzężenia zwrotnego gromadzi poprawki użytkowników i etykiety wartości rzeczywistych (np. informację, czy użytkownik kliknął rekomendację albo czy oznaczenie transakcji jako oszustwa było prawidłowe), a następnie przekazuje je z powrotem jako świeże dane treningowe.

Zamykanie pętli za pomocą ponownego trenowania

Wykrywanie dryfu i pętla sprzężenia zwrotnego wspólnie uruchamiają ponowne trenowanie: gdy PSI przekroczy próg albo dokładność na świeżych etykietach spadnie, potok ponownie trenuje model na najnowszych danych i wdraża go ponownie. Dzięki temu model pozostaje dostosowany do zmieniającego się świata.

Szybki test

Sprawdź swoją wiedzę na temat obserwowalności.

Podsumowanie

Poznali Państwo obserwowalność i monitorowanie systemów AI:

  • Prometheus zbiera metryki; opóźnienie wnioskowania należy raportować jako P50/P95
  • Pulpity Grafana umożliwiają szybki podgląd stanu systemu
  • Dryf danych mierzy się za pomocą PSI; PSI > 0.2 oznacza konieczność ponownego trenowania
  • Pętla sprzężenia zwrotnego przekształca poprawki użytkowników w dane do ponownego trenowania

Często zadawane pytania

Czy lekcja „Obserwowalność i monitorowanie systemów AI” jest bezpłatna?

Tak — pełny tekst „Obserwowalność i monitorowanie systemów AI” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Learn AI with Python, przejdź na CoddyKit PRO. Kurs Learn AI with Python zawiera 4 lekcji w sumie.

Co nauczysz się w „Obserwowalność i monitorowanie systemów AI”?

Panele wydajności modeli, alerty dotyczące dryfu danych, pętle informacji zwrotnej, wdrażanie w trybie shadow. Ćwiczysz Learn AI with Python z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Learn AI with Python?

Nie wymagamy żadnego doświadczenia. Learn AI with Python w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Obserwowalność i monitorowanie systemów AI”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Learn AI with Python?

Tak. Każda lekcja Learn AI with Python zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Wzorce architektury systemów AI
  2. Skalowalne potoki ML z Airflow
  3. Magazyny cech: Feast i Tecton
  4. Obserwowalność i monitorowanie systemów AI
← Powrót do Learn AI with Python