0Pricing
MLOps Academy · Lezione

Eseguire più istanze del modello per GPU

Usi l'esecuzione concorrente per aumentare l'utilizzo.

Eseguire più istanze del modello per GPU è una lezione MLOps Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento MLOps Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso MLOps Academy include 4 lezioni in totale.

Una copia può bloccare tutto

Con una sola copia del modello, la richiesta due deve attendere mentre viene elaborata la richiesta uno. Anche una GPU veloce può rimanere inattiva tra una chiamata e l'altra, riducendo il throughput.

Eseguire più copie

Triton può caricare più istanze dello stesso modello, in modo che diverse richieste vengano eseguite contemporaneamente e il loro lavoro si sovrapponga sulla GPU.

Il blocco instance_group

Le copie vengono dichiarate con instance_group in config.pbtxt. Il campo count indica quante istanze Triton deve creare per quel modello.

instance_group {
  count: 2
  kind: KIND_GPU
}

Scegliere GPU o CPU

Il campo kind sceglie il dispositivo. KIND_GPU esegue le istanze sulla GPU, mentre KIND_CPU le esegue sul processore host.

Distribuirle sulle GPU

È possibile assegnare le istanze a schede specifiche con un elenco gpus. In questo modo un modello può distribuire le proprie copie su più GPU dello stesso server.

instance_group {
  count: 2
  kind: KIND_GPU
  gpus: [ 0, 1 ]
}

Perché è utile

Mentre un'istanza esegue i calcoli, un'altra può caricare gli input o copiare i risultati. Questa sovrapposizione nasconde i periodi di inattività e aumenta l'utilizzo complessivo.

Si abbina al batching

Le istanze e il batching dinamico lavorano insieme. Il batching riempie ogni chiamata, mentre più istanze mantengono contemporaneamente più di una chiamata in esecuzione.

Controllare la memoria

Ogni istanza conserva una propria copia dei pesi nella memoria della GPU. Troppe copie fanno esaurire la VRAM, quindi aumenti gradualmente il numero.

Di più non significa sempre più veloce

Oltre una certa soglia, le istanze aggiuntive si limitano a contendersi le stesse risorse di calcolo. Il throughput si stabilizza o diminuisce, quindi il numero ottimale va determinato con le misurazioni, non con supposizioni.

Tenere presente la concorrenza

Il numero corretto di istanze dipende da quante richieste arrivano contemporaneamente. Abbini le istanze alla Sua reale concorrenza per evitare sia blocchi sia sprechi.

Un punto di partenza ragionevole

Due istanze per GPU sono un comune punto di partenza. Esegua test con un carico realistico, quindi aumenti o riduca il numero in base a ciò che osserva.

Verifica rapida

Che cosa comporta impostare count su 2 in un instance_group?

Riepilogo

Ha imparato a eseguire diverse copie del modello tramite instance_group, abbinando le istanze al batching per ottenere parallelismo, monitorando la VRAM e ottimizzando il numero in base alle misurazioni. 🙌

Domande Frequenti

La lezione «Eseguire più istanze del modello per GPU» è gratuita?

Sì — il testo completo di «Eseguire più istanze del modello per GPU» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso MLOps Academy, passa a CoddyKit PRO. Il corso MLOps Academy include 4 lezioni in totale.

Cosa imparerò in «Eseguire più istanze del modello per GPU»?

Usi l'esecuzione concorrente per aumentare l'utilizzo. Eserciti MLOps Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare MLOps Academy?

Non è richiesta alcuna esperienza precedente. MLOps Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Eseguire più istanze del modello per GPU»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione MLOps Academy?

Sì. Ogni lezione MLOps Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché le GPU richiedono il batching
  2. Configurare il batching dinamico in Triton
  3. Eseguire più istanze del modello per GPU
  4. Profilare e ottimizzare la latenza dell'inferenza
← Torna a MLOps Academy