Synkron batch norm og sharded state
Hold statistik og vægte konsistente.
Synkron batch norm og sharded state er en gratis Deep Learning Academy-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Deep Learning Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Deep Learning Academy-kurset indeholder 4 lektioner i alt.
Problemet med små batches
Batchnormalisering beregner statistik ud fra hver GPU's lokale batch. Når batchen fordeles på mange GPU'er, bliver hver batch pr. enhed mindre, og statistikken bliver støjfyldt.
Introduktion til SyncBatchNorm
SyncBatchNorm løser dette ved at beregne middelværdi og varians på tværs af alle GPU'er samlet, som om den så hele den globale batch.
Konvertér med ét kald
Du behøver ikke omskrive lagene manuelt. Én hjælpefunktion konverterer al BatchNorm i din model til den synkroniserede version.
import torch.nn as nn
model = nn.SyncBatchNorm.convert_sync_batchnorm(model)Konvertér før indpakning
Rækkefølgen er vigtig: kald konverteringen før du pakker modellen ind i DDP, så det er de synkroniserede lag, DDP administrerer.
model = nn.SyncBatchNorm.convert_sync_batchnorm(model)
model = DDP(model, device_ids=[local_rank])Det koster kommunikation
Synkronisering af statistik betyder en ekstra all-reduce ved hvert batchnormaliseringslag. Brug det, når små batches pr. GPU forringer nøjagtigheden, ikke som standard.
Hukommelsesmuren
Almindelig DDP kopierer hele modellen, gradienterne og optimeringstilstanden til hver GPU. For enorme modeller spilder denne redundans hurtigt hukommelse.
Opsplit tilstanden
Opsplitning fordeler disse tensorer på GPU'erne, så hver enhed kun gemmer en del. Tilsammen indeholder GPU'erne stadig hele modellen.
Mød FSDP
PyTorch's FullyShardedDataParallel opsplitter parametre, gradienter og optimeringstilstand. Det gør det muligt at træne modeller, der er langt større end én GPU's hukommelse.
from torch.distributed.fsdp import FullyShardedDataParallel as FSDP
model = FSDP(model)Saml kun efter behov
FSDP samler hvert lags fulde vægte kun når der er brug for dem til beregningen og frigiver dem derefter igen. Det holder spidshukommelsen lav.
ZeRO-niveauer
Opsplitning findes i niveauer, der kaldes ZeRO-niveauer: først opsplitter du optimeringstilstanden, derefter gradienterne og til sidst parametrene. Mere opsplitning sparer mere hukommelse.
Vælg det rigtige værktøj
Hvis din model kan være på hver GPU, er almindelig DDP enklest. Hvis den ikke kan, skal du bruge FSDP til at opsplitte tilstanden og fortsætte.
Hurtigt tjek
Vurdér, hvad hver teknik egentlig er beregnet til.
Opsummering
Du har mødt to værktøjer til konsistens: SyncBatchNorm holder statistikken global på tværs af GPU'er, og FSDP opsplitter tilstanden, så enorme modeller kan være der. Brug kun hver teknik, når du har brug for den.
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 30
- Lektioner
- 120
Ofte stillede spørgsmål
Er lektionen “Synkron batch norm og sharded state” gratis?
Ja — hele teksten til “Synkron batch norm og sharded state” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Deep Learning Academy-kurset, skal du opgradere til CoddyKit PRO. Deep Learning Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Synkron batch norm og sharded state”?
Hold statistik og vægte konsistente. Du øver dig i Deep Learning Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Deep Learning Academy?
Der kræves ingen tidligere erfaring. Deep Learning Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.
Hvor lang tid tager lektionen “Synkron batch norm og sharded state”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Deep Learning Academy-lektion?
Ja. Alle Deep Learning Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Data- vs. modelparallelisme
- Grundlæggende DistributedDataParallel
- Synkron batch norm og sharded state
- Start jobs med torchrun