0Pricing
Learn AI with Python · Lezione

Osservabilità e monitoraggio dei sistemi di AI

Dashboard delle prestazioni del modello, avvisi di data drift, cicli di feedback, deployment in shadow mode

Osservabilità e monitoraggio dei sistemi di AI è una lezione Learn AI with Python gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Learn AI with Python, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Learn AI with Python include 4 lezioni in totale.

Perché monitorare i sistemi di ML

Un modello distribuito non è un lavoro concluso. Il traffico aumenta improvvisamente, la latenza cresce gradualmente e il mondo cambia, facendo allontanare i dati da quelli usati durante il training. L'osservabilità indica se il sistema è in buona salute e se il modello è ancora accurato, prima che gli utenti ne subiscano le conseguenze.

Due tipi di monitoraggio

L'osservabilità del ML comprende due livelli:

  • operativo: latenza, throughput, errori e utilizzo delle risorse, come per qualsiasi servizio
  • del modello: data drift, distribuzione delle predizioni e accuratezza nel tempo, aspetti specifici del ML

Prometheus per le metriche

Prometheus è il sistema standard per raccogliere metriche di serie temporali. Il servizio espone un endpoint per le metriche; Prometheus lo interroga a intervalli regolari e memorizza i valori per le query e gli avvisi.

Strumentazione della latenza

Si registra la latenza dell'inferenza con un istogramma di Prometheus. Gli istogrammi consentono di calcolare i percentili, il modo corretto di riassumere la latenza, invece di una media fuorviante.

from prometheus_client import Histogram

INFER_LATENCY = Histogram(
    "inference_latency_seconds",
    "Model inference latency",
)

@INFER_LATENCY.time()
def predict(x):
    return model(x)

Latenza P50 e P95

Si rappresenta la latenza come percentili. P50 (mediana) rappresenta l'esperienza tipica; P95 rappresenta la coda lenta, che viene superata dal 5% delle richieste. Monitorare P95 permette di rilevare problemi che la media nasconde, perché anche poche richieste lente danneggiano l'esperienza degli utenti.

Dashboard Grafana

Grafana visualizza le metriche di Prometheus sotto forma di dashboard aggiornate in tempo reale. Una dashboard del modello mostra in genere su un'unica schermata il tasso di richieste, il tasso di errori, la latenza P50/P95 e la distribuzione delle predizioni, per valutare lo stato del sistema a colpo d'occhio.

Che cos'è il data drift

Il data drift si verifica quando la distribuzione degli input in produzione si allontana dalla distribuzione di addestramento. Il modello è stato addestrato su pattern ormai vecchi, quindi, man mano che gli input cambiano, la sua accuratezza diminuisce silenziosamente anche se non è stato modificato alcun codice.

Indice di stabilità della popolazione

L'indice di stabilità della popolazione (PSI) quantifica il data drift confrontando la distribuzione attuale di una caratteristica con quella presente durante l'addestramento. Suddivide entrambe le distribuzioni in intervalli e somma un rapporto logaritmico ponderato tra gli intervalli.

# PSI = sum over bins of
#   (actual_pct - expected_pct) * ln(actual_pct / expected_pct)

Interpretare il PSI

Soglie convenzionali del PSI:

  • PSI < 0.1: nessun drift significativo
  • da 0.1 a 0.2: drift moderato, da analizzare
  • PSI > 0.2: drift significativo, probabilmente il modello deve essere riaddestrato

Generare un avviso quando il PSI supera 0.2 è una pratica comune.

Il ciclo di feedback

Il segnale di monitoraggio più prezioso proviene dai risultati reali. Un ciclo di feedback raccoglie le correzioni degli utenti e le etichette di riferimento (ad esempio, se un consiglio è stato selezionato o se un'indicazione di frode era corretta) e le reinserisce come nuovi dati di addestramento.

Chiudere il ciclo con il riaddestramento

Il rilevamento del drift e il ciclo di feedback attivano insieme il riaddestramento: quando il PSI supera la soglia o l'accuratezza sulle nuove etichette diminuisce, la pipeline riaddestra il modello sui dati più recenti e lo ridistribuisce. In questo modo il modello rimane allineato con un mondo in continua evoluzione.

Verifica rapida

Metta alla prova le sue conoscenze sull'osservabilità.

Riepilogo

Ha appreso i concetti di osservabilità e monitoraggio dei sistemi di IA:

  • Prometheus raccoglie le metriche; riporti la latenza di inferenza come P50/P95
  • Le dashboard di Grafana visualizzano lo stato del sistema a colpo d'occhio
  • Il data drift viene misurato con il PSI; un PSI > 0.2 indica che è necessario riaddestrare il modello
  • Un ciclo di feedback trasforma le correzioni degli utenti in dati per il riaddestramento

Domande Frequenti

La lezione «Osservabilità e monitoraggio dei sistemi di AI» è gratuita?

Sì — il testo completo di «Osservabilità e monitoraggio dei sistemi di AI» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Learn AI with Python, passa a CoddyKit PRO. Il corso Learn AI with Python include 4 lezioni in totale.

Cosa imparerò in «Osservabilità e monitoraggio dei sistemi di AI»?

Dashboard delle prestazioni del modello, avvisi di data drift, cicli di feedback, deployment in shadow mode Eserciti Learn AI with Python con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Learn AI with Python?

Non è richiesta alcuna esperienza precedente. Learn AI with Python su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Osservabilità e monitoraggio dei sistemi di AI»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Learn AI with Python?

Sì. Ogni lezione Learn AI with Python include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Pattern architetturali per sistemi di AI
  2. Pipeline ML scalabili con Airflow
  3. Feature store: Feast e Tecton
  4. Osservabilità e monitoraggio dei sistemi di AI
← Torna a Learn AI with Python