MLOps Academy · Lezione

Profilare e ottimizzare la latenza dell'inferenza

Usi perf_analyzer per trovare il punto di equilibrio.

Lezione 4 di 413 passaggi

Profilare e ottimizzare la latenza dell'inferenza è una lezione MLOps Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento MLOps Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso MLOps Academy include 4 lezioni in totale.

Ottimizzare misurando

Non è possibile ottimizzare ciò che non si misura. Prima di modificare le impostazioni, raccolga valori reali di latenza e throughput sotto un carico affidabile. 📏

Presentiamo perf_analyzer

Triton include perf_analyzer, uno strumento che sottopone il modello a numerose richieste e restituisce latenza e throughput, così può confrontare le configurazioni.

Eseguire un test di base

Indichi un modello a perf_analyzer: lo strumento invierà richieste sintetiche, quindi mostrerà le inferenze al secondo e la suddivisione della latenza.

perf_analyzer -m my_model

Variare la concorrenza

L'opzione più utile varia la concorrenza, cioè il numero di richieste contemporaneamente in esecuzione. Mostra come cambiano throughput e latenza all'aumentare del carico.

perf_analyzer -m my_model --concurrency-range 1:8

Leggere la curva

All'aumentare della concorrenza, il throughput cresce e poi si stabilizza, mentre la latenza continua ad aumentare. Il punto di flesso della curva è il Suo punto operativo pratico.

Utilizzare i percentili

Le medie nascondono i problemi. Controlli la latenza p95, il valore al di sotto del quale rientra il 95% delle richieste, perché è la latenza di coda che gli utenti percepiscono davvero.

Ottimizzare il ritardo della coda

Se la latenza è troppo alta, riduca max_queue_delay_microseconds. Se il throughput è troppo basso sotto carico intenso, lo aumenti per creare batch più completi.

Ottimizzare le istanze

Se la GPU è utilizzata poco, aggiunga un'istanza. Se la memoria è scarsa o il throughput si blocca, ne rimuova una. Modifichi un solo parametro alla volta e misuri di nuovo.

Cambiare una cosa alla volta

L'ottimizzazione è un ciclo, non un salto. Modifichi una sola impostazione, esegua di nuovo perf_analyzer, confronti i risultati e mantenga la modifica solo se i numeri migliorano davvero.

Stabilire un budget di latenza

Decida prima il Suo budget, ad esempio p95 inferiore a 50 ms. Poi aumenti dimensione dei batch e numero di istanze fin dove possibile, restando entro quel limite.

Considerare l'intero percorso

I numeri del server non raccontano tutta la storia. I passaggi di rete e il codice del client aggiungono tempo, quindi misuri anche la latenza end-to-end dal punto in cui si trova l'utente.

Verifica rapida

Perché, durante l'ottimizzazione, è preferibile la latenza p95 alla latenza media?

Riepilogo

Ha utilizzato perf_analyzer per variare la concorrenza, ha analizzato la curva throughput-latenza al p95 e ha ottimizzato il ritardo della coda e le istanze rispettando un budget, una modifica alla volta. 🙌

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Profilare e ottimizzare la latenza dell'inferenza» è gratuita?

Sì — il testo completo di «Profilare e ottimizzare la latenza dell'inferenza» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso MLOps Academy, passa a CoddyKit PRO. Il corso MLOps Academy include 4 lezioni in totale.

Cosa imparerò in «Profilare e ottimizzare la latenza dell'inferenza»?

Usi perf_analyzer per trovare il punto di equilibrio. Eserciti MLOps Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare MLOps Academy?

Non è richiesta alcuna esperienza precedente. MLOps Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Profilare e ottimizzare la latenza dell'inferenza»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione MLOps Academy?

Sì. Ogni lezione MLOps Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché le GPU richiedono il batching
  2. Configurare il batching dinamico in Triton
  3. Eseguire più istanze del modello per GPU
  4. Profilare e ottimizzare la latenza dell'inferenza
← Torna a MLOps Academy