MLOps Academy · Lezione

Inferenza online in tempo reale

Serva previsioni a bassa latenza per ogni richiesta.

Lezione 2 di 413 passaggi

Inferenza online in tempo reale è una lezione MLOps Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento MLOps Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso MLOps Academy include 4 lezioni in totale.

Che cos’è l’inferenza online

L’inferenza online risponde a una richiesta alla volta, nell’istante in cui arriva, così un utente o un servizio riceve subito una predizione aggiornata. ⚡

Un utente è in attesa

A differenza del batch, qui qualcuno attende la risposta. La predizione deve arrivare in millisecondi, non in minuti, per risultare reattiva.

Vive dietro un’API

Un modello online si trova dietro un endpoint HTTP. Un client invia le feature in una richiesta e riceve la predizione nella risposta.

# POST /predict {"features": [5.1, 3.5, 1.4]}

Una richiesta, una predizione

Ogni chiamata contiene l’input per un singolo caso. Il servizio esegue predict su di esso e restituisce il punteggio, quindi gestisce il chiamante successivo.

def predict(req):
    x = parse(req.features)
    return model.predict([x])[0]

Input sempre aggiornati

Poiché le feature arrivano insieme alla richiesta, il punteggio riflette lo stato più recente: è perfetto quando gli input cambiano di secondo in secondo.

La latenza è la metrica

Il valore da monitorare è la latenza: il tempo che intercorre tra la richiesta e la risposta. Spesso si osservano il 95° e il 99° percentile, che rappresentano le richieste più lente, non solo la media.

Caricare il modello una sola volta

Caricare il modello a ogni richiesta sarebbe lento. Invece, lo si carica una volta all’avvio e lo si riutilizza per tutte le chiamate in arrivo.

La concorrenza è importante

Molti utenti accedono al servizio contemporaneamente. Per mantenere bassa la latenza sotto carico, il servizio deve gestire le richieste in parallelo, spesso con più worker.

Esempi dal mondo reale

I controlli antifrode al checkout, il ranking delle ricerche e i widget di raccomandazione hanno tutti bisogno di risposte immediate, quindi usano l’inferenza online.

Il costo di essere sempre disponibili

Un servizio online deve rimanere in esecuzione e pronto 24 ore su 24. Questa infrastruttura sempre attiva costa più di un job che viene avviato e poi arrestato.

Quando scegliere l’online

Scelga l’online quando gli input non sono noti in anticipo e gli utenti hanno bisogno di una risposta aggiornata subito, accettando costi e impegno operativo maggiori.

Verifica rapida

Quale metrica è più importante per l’inferenza online?

Riepilogo

L’inferenza online fornisce una predizione aggiornata per ogni richiesta tramite un’API, punta a una latenza ridotta e costa di più perché deve rimanere sempre attiva.

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Inferenza online in tempo reale» è gratuita?

Sì — il testo completo di «Inferenza online in tempo reale» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso MLOps Academy, passa a CoddyKit PRO. Il corso MLOps Academy include 4 lezioni in totale.

Cosa imparerò in «Inferenza online in tempo reale»?

Serva previsioni a bassa latenza per ogni richiesta. Eserciti MLOps Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare MLOps Academy?

Non è richiesta alcuna esperienza precedente. MLOps Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.

Quanto tempo richiede la lezione «Inferenza online in tempo reale»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione MLOps Academy?

Sì. Ogni lezione MLOps Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Scoring batch pianificato
  2. Inferenza online in tempo reale
  3. Compromessi tra latenza, throughput e costi
  4. Precalcolare e memorizzare nella cache le previsioni
← Torna a MLOps Academy