Flera GPU:er med NCCL
Kollektiv kommunikation för skalning
Flera GPU:er med NCCL är en gratis lektion i CUDA Academy på CoddyKit. Detta är lektion 4 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för CUDA Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i CUDA Academy innehåller totalt 4 lektioner.
Handskrivet blir svårt
Att koppla peer-kopieringar manuellt mellan många GPU:er blir snabbt rörigt. För verklig skalning behöver Ni ett bibliotek som är byggt för collective-kommunikation.
Möt NCCL
NVIDIAs svar är NCCL, biblioteket för kollektiv kommunikation. Det flyttar data mellan GPU:er via de snabbaste länkar som finns tillgängliga, automatiskt.
Vad en kollektiv operation är
En collective är en operation som alla GPU:er deltar i tillsammans, till exempel att summera ett värde som finns på varje kort. Alla enheter samarbetar i ett enda anrop.
Den centrala kollektiva operationen: AllReduce
Arbetshästen är AllReduce. Den kombinerar en buffer från varje GPU, exempelvis genom addition, och lämnar tillbaka samma resultat till alla.
ncclAllReduce(send, recv, n, ncclFloat, ncclSum, comm, stream);Fler kollektiva operationer
NCCL erbjuder även Broadcast för att dela en GPU:s data med alla, samt AllGather och ReduceScatter för andra vanliga utbytesmönster.
Communicatorn
GPU:erna som kommunicerar med varandra bildar en grupp som hanteras av en communicator. Varje kollektivt anrop skickar med denna handle så att NCCL känner till deltagarna.
Ranks identifierar GPU:er
Inuti en communicator får varje GPU ett nummer som kallas dess rank, från 0 och uppåt. Ranks låter Er ange vem som skickar, vem som tar emot och vem som är root.
Skapa communicatorerna
För GPU:er i en process konfigurerar ncclCommInitAll alla communicatorer samtidigt utifrån listan med device-id:n som Ni anger.
ncclCommInitAll(comms, nGpus, devs);Medveten om streams
Varje NCCL-anrop tar en stream. Operationerna köas där och körs parallellt med Era kernlar, så att kommunikation överlappar beräkningar.
Gruppera anrop
För att utföra kollektiva operationer på många GPU:er utan deadlock omsluter Ni dem med ncclGroupStart och ncclGroupEnd, så att NCCL startar dem tillsammans.
ncclGroupStart();
// per-GPU calls
ncclGroupEnd();Varför det är idealiskt för träning
Djupinlärning synkroniserar gradienter mellan GPU:er vid varje steg. AllReduce gör exakt detta, vilket är anledningen till att NCCL används för nästan all träning på flera GPU:er.
Snabb kontroll
Kom ihåg vilken kollektiv operation i NCCL som summerar en buffer över GPU:erna och returnerar resultatet till dem alla.
Sammanfattning
NCCL kör kollektiva operationer som AllReduce över snabba länkar, organiserade av en kommunikator med rangordnade GPU:er. Det är ryggraden i träning med flera GPU:er. Kursen är klar. ✨
Lär dig C++ med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 30
- Lektioner
- 120
Vanliga frågor
Är lektionen ”Flera GPU:er med NCCL” gratis?
Ja – hela texten till ”Flera GPU:er med NCCL” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i CUDA Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i CUDA Academy innehåller totalt 4 lektioner.
Vad lär jag mig i ”Flera GPU:er med NCCL”?
Kollektiv kommunikation för skalning Ni övar på CUDA Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig CUDA Academy?
Du behöver inga förkunskaper. Utbildningen i CUDA Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 4 av 4.
Hur lång tid tar lektionen ”Flera GPU:er med NCCL”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här CUDA Academy-lektionen?
Ja. Varje CUDA Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Räkna upp och välja enheter
- Partitionera arbete över GPU:er
- Peer-to-peer-minnesåtkomst
- Flera GPU:er med NCCL