Il ciclo di vita di un programma CUDA
Allochi, copi, avvii, ricopi e liberi la memoria.
Il ciclo di vita di un programma CUDA è una lezione CUDA Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento CUDA Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso CUDA Academy include 4 lezioni in totale.
Un ritmo ripetitivo
Quasi ogni programma CUDA segue la stessa sequenza in cinque fasi. Imparate una volta il ritmo e potrete leggere qualsiasi codice per GPU. 🕺
Fase 1: Allocazione
Per prima cosa riservate la memoria del device per gli input e gli output con cudaMalloc, perché la GPU non può usare direttamente i buffer dell’host.
cudaMalloc(&d_a, bytes);
cudaMalloc(&d_b, bytes);Fase 2: Copia in ingresso
Successivamente caricate i dati di input dall’host al device con cudaMemcpy. Ora la GPU dispone di una propria copia su cui lavorare.
cudaMemcpy(d_a, h_a, bytes, cudaMemcpyHostToDevice);Fase 3: Avvio
Ora avviate il kernel su numerosi thread. È qui che il lavoro parallelo viene effettivamente eseguito sul device. 🚀
myKernel<<<blocks, threads>>>(d_a, d_b, n);Fase 4: Copia all’indietro
Al termine del calcolo, scaricate i risultati dal device all’host, così la CPU può leggerli e utilizzarli.
cudaMemcpy(h_b, d_b, bytes, cudaMemcpyDeviceToHost);Fase 5: Deallocazione
Infine rilasciate ogni buffer del device con cudaFree. Se saltate questo passaggio, lasciate occupata memoria della GPU che potrebbe essere utilizzata da altre operazioni.
cudaFree(d_a);
cudaFree(d_b);Non dimenticate la sincronizzazione
Poiché gli avvii sono asincroni, chiamate cudaDeviceSynchronize prima di leggere i risultati, per assicurarvi che la GPU abbia davvero terminato.
cudaDeviceSynchronize();Le copie richiedono tempo
I passaggi di copia attraversano il bus PCIe, che è lento, quindi il trasferimento dei dati è spesso il vero collo di bottiglia, non il kernel in sé.
Riutilizzate i buffer
Allocare una volta sola e riutilizzare i buffer tra numerosi avvii è più efficiente che allocare memoria nuova a ogni iterazione di un ciclo.
Simmetria dello schema
Notate la simmetria: a ogni cudaMalloc corrisponde un cudaFree e ogni copia in ingresso è accompagnata da una copia in uscita.
Il ciclo di vita in una frase
Ripetetelo come un mantra: allocare, copiare, avviare, copiare all’indietro, deallocare. Questa singola sequenza è lo scheletro di quasi ogni programma con kernel.
Verifica rapida
Verifichiamo il ciclo di vita standard di un programma CUDA.
Riepilogo
Avete imparato il ciclo di vita CUDA in cinque fasi: allocare, copiare in ingresso, avviare, copiare all’indietro, deallocare, oltre alla sincronizzazione prima di leggere i risultati. 🎉
Impara C++ con un tutor IA — gratis
Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.
- Corsi
- 30
- Lezioni
- 120
Domande Frequenti
La lezione «Il ciclo di vita di un programma CUDA» è gratuita?
Sì — il testo completo di «Il ciclo di vita di un programma CUDA» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso CUDA Academy, passa a CoddyKit PRO. Il corso CUDA Academy include 4 lezioni in totale.
Cosa imparerò in «Il ciclo di vita di un programma CUDA»?
Allochi, copi, avvii, ricopi e liberi la memoria. Eserciti CUDA Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare CUDA Academy?
Non è richiesta alcuna esperienza precedente. CUDA Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.
Quanto tempo richiede la lezione «Il ciclo di vita di un programma CUDA»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione CUDA Academy?
Sì. Ogni lezione CUDA Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Il qualificatore di funzione __global__
- Funzioni __device__ e __host__
- Spazi di indirizzamento separati
- Il ciclo di vita di un programma CUDA