CUDA Academy · Lektion

Flera GPU:er med NCCL

Kollektiv kommunikation för skalning

Lektion 4 av 413 steg

Flera GPU:er med NCCL är en gratis lektion i CUDA Academy på CoddyKit. Detta är lektion 4 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för CUDA Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i CUDA Academy innehåller totalt 4 lektioner.

Handskrivet blir svårt

Att koppla peer-kopieringar manuellt mellan många GPU:er blir snabbt rörigt. För verklig skalning behöver Ni ett bibliotek som är byggt för collective-kommunikation.

Möt NCCL

NVIDIAs svar är NCCL, biblioteket för kollektiv kommunikation. Det flyttar data mellan GPU:er via de snabbaste länkar som finns tillgängliga, automatiskt.

Vad en kollektiv operation är

En collective är en operation som alla GPU:er deltar i tillsammans, till exempel att summera ett värde som finns på varje kort. Alla enheter samarbetar i ett enda anrop.

Den centrala kollektiva operationen: AllReduce

Arbetshästen är AllReduce. Den kombinerar en buffer från varje GPU, exempelvis genom addition, och lämnar tillbaka samma resultat till alla.

ncclAllReduce(send, recv, n, ncclFloat, ncclSum, comm, stream);

Fler kollektiva operationer

NCCL erbjuder även Broadcast för att dela en GPU:s data med alla, samt AllGather och ReduceScatter för andra vanliga utbytesmönster.

Communicatorn

GPU:erna som kommunicerar med varandra bildar en grupp som hanteras av en communicator. Varje kollektivt anrop skickar med denna handle så att NCCL känner till deltagarna.

Ranks identifierar GPU:er

Inuti en communicator får varje GPU ett nummer som kallas dess rank, från 0 och uppåt. Ranks låter Er ange vem som skickar, vem som tar emot och vem som är root.

Skapa communicatorerna

För GPU:er i en process konfigurerar ncclCommInitAll alla communicatorer samtidigt utifrån listan med device-id:n som Ni anger.

ncclCommInitAll(comms, nGpus, devs);

Medveten om streams

Varje NCCL-anrop tar en stream. Operationerna köas där och körs parallellt med Era kernlar, så att kommunikation överlappar beräkningar.

Gruppera anrop

För att utföra kollektiva operationer på många GPU:er utan deadlock omsluter Ni dem med ncclGroupStart och ncclGroupEnd, så att NCCL startar dem tillsammans.

ncclGroupStart();
// per-GPU calls
ncclGroupEnd();

Varför det är idealiskt för träning

Djupinlärning synkroniserar gradienter mellan GPU:er vid varje steg. AllReduce gör exakt detta, vilket är anledningen till att NCCL används för nästan all träning på flera GPU:er.

Snabb kontroll

Kom ihåg vilken kollektiv operation i NCCL som summerar en buffer över GPU:erna och returnerar resultatet till dem alla.

Sammanfattning

NCCL kör kollektiva operationer som AllReduce över snabba länkar, organiserade av en kommunikator med rangordnade GPU:er. Det är ryggraden i träning med flera GPU:er. Kursen är klar. ✨

Gratis att börja

Lär dig C++ med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Flera GPU:er med NCCL” gratis?

Ja – hela texten till ”Flera GPU:er med NCCL” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i CUDA Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i CUDA Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Flera GPU:er med NCCL”?

Kollektiv kommunikation för skalning Ni övar på CUDA Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig CUDA Academy?

Du behöver inga förkunskaper. Utbildningen i CUDA Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 4 av 4.

Hur lång tid tar lektionen ”Flera GPU:er med NCCL”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här CUDA Academy-lektionen?

Ja. Varje CUDA Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Räkna upp och välja enheter
  2. Partitionera arbete över GPU:er
  3. Peer-to-peer-minnesåtkomst
  4. Flera GPU:er med NCCL
← Tillbaka till CUDA Academy