CUDA Academy · Lezione

Il ciclo di vita di un programma CUDA

Allochi, copi, avvii, ricopi e liberi la memoria.

Lezione 4 di 413 passaggi

Il ciclo di vita di un programma CUDA è una lezione CUDA Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento CUDA Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso CUDA Academy include 4 lezioni in totale.

Un ritmo ripetitivo

Quasi ogni programma CUDA segue la stessa sequenza in cinque fasi. Imparate una volta il ritmo e potrete leggere qualsiasi codice per GPU. 🕺

Fase 1: Allocazione

Per prima cosa riservate la memoria del device per gli input e gli output con cudaMalloc, perché la GPU non può usare direttamente i buffer dell’host.

cudaMalloc(&d_a, bytes);
cudaMalloc(&d_b, bytes);

Fase 2: Copia in ingresso

Successivamente caricate i dati di input dall’host al device con cudaMemcpy. Ora la GPU dispone di una propria copia su cui lavorare.

cudaMemcpy(d_a, h_a, bytes, cudaMemcpyHostToDevice);

Fase 3: Avvio

Ora avviate il kernel su numerosi thread. È qui che il lavoro parallelo viene effettivamente eseguito sul device. 🚀

myKernel<<<blocks, threads>>>(d_a, d_b, n);

Fase 4: Copia all’indietro

Al termine del calcolo, scaricate i risultati dal device all’host, così la CPU può leggerli e utilizzarli.

cudaMemcpy(h_b, d_b, bytes, cudaMemcpyDeviceToHost);

Fase 5: Deallocazione

Infine rilasciate ogni buffer del device con cudaFree. Se saltate questo passaggio, lasciate occupata memoria della GPU che potrebbe essere utilizzata da altre operazioni.

cudaFree(d_a);
cudaFree(d_b);

Non dimenticate la sincronizzazione

Poiché gli avvii sono asincroni, chiamate cudaDeviceSynchronize prima di leggere i risultati, per assicurarvi che la GPU abbia davvero terminato.

cudaDeviceSynchronize();

Le copie richiedono tempo

I passaggi di copia attraversano il bus PCIe, che è lento, quindi il trasferimento dei dati è spesso il vero collo di bottiglia, non il kernel in sé.

Riutilizzate i buffer

Allocare una volta sola e riutilizzare i buffer tra numerosi avvii è più efficiente che allocare memoria nuova a ogni iterazione di un ciclo.

Simmetria dello schema

Notate la simmetria: a ogni cudaMalloc corrisponde un cudaFree e ogni copia in ingresso è accompagnata da una copia in uscita.

Il ciclo di vita in una frase

Ripetetelo come un mantra: allocare, copiare, avviare, copiare all’indietro, deallocare. Questa singola sequenza è lo scheletro di quasi ogni programma con kernel.

Verifica rapida

Verifichiamo il ciclo di vita standard di un programma CUDA.

Riepilogo

Avete imparato il ciclo di vita CUDA in cinque fasi: allocare, copiare in ingresso, avviare, copiare all’indietro, deallocare, oltre alla sincronizzazione prima di leggere i risultati. 🎉

Gratis per iniziare

Impara C++ con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Il ciclo di vita di un programma CUDA» è gratuita?

Sì — il testo completo di «Il ciclo di vita di un programma CUDA» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso CUDA Academy, passa a CoddyKit PRO. Il corso CUDA Academy include 4 lezioni in totale.

Cosa imparerò in «Il ciclo di vita di un programma CUDA»?

Allochi, copi, avvii, ricopi e liberi la memoria. Eserciti CUDA Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare CUDA Academy?

Non è richiesta alcuna esperienza precedente. CUDA Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Il ciclo di vita di un programma CUDA»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione CUDA Academy?

Sì. Ogni lezione CUDA Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Il qualificatore di funzione __global__
  2. Funzioni __device__ e __host__
  3. Spazi di indirizzamento separati
  4. Il ciclo di vita di un programma CUDA
← Torna a CUDA Academy