Deep Learning Academy · Lektion

Stak en Transformer-encoderblok

Attention plus feedforward og normer.

Lektion 4 af 413 trin

Stak en Transformer-encoderblok er en gratis Deep Learning Academy-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Deep Learning Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Deep Learning Academy-kurset indeholder 4 lektioner i alt.

Byggeklodsen

En transformer er blot én encoderblok, der gentages. Lær blokken, så forstår du hele tårnet, fra små modeller til enorme modeller.

To underlag

Hver blok har to dele: et opmærksomhedslag med flere hoveder og derefter et lille feedforward-netværk. Begge er omsluttet af residualforbindelser og normalisering.

Opmærksomhed først

Blokken begynder med selvopmærksomhed, som lader hvert token blande kontekst fra resten af sekvensen ind, før yderligere behandling finder sted.

attn_out, _ = self.attn(x, x, x)

Residualforbindelsen

En residual føjer underlagets input tilbage til dets output. Denne genvej lader gradienter flyde og holder dybe stakke træningsbare.

x = x + attn_out

Lag-normalisering

Efter residualen er tilføjet, omskalerer lag-normalisering hvert tokens egenskaber til en stabil fordeling og gør træningen mere stabil på tværs af lag.

x = self.norm1(x)

Feedforward-netværket

Dernæst kommer et positionsvist feedforward-netværk: udvid til en bredere skjult størrelse, anvend en ikke-linearitet, og projicér derefter ned igen.

ff = nn.Sequential(nn.Linear(d, 4*d), nn.GELU(), nn.Linear(4*d, d))

Behandling pr. token

Feedforward-laget behandler hvert token uafhængigt. Opmærksomheden delte information; dette trin finjusterer hvert token for sig.

Anden residual og normalisering

Feedforward-outputtet behandles på samme måde: en residual tilføjes, efterfulgt af endnu en lag-normalisering, som afslutter blokken.

x = self.norm2(x + ff(x))

Stabl dem dybt

Stabl mange identiske blokke, så bygger modellen rigere repræsentationer lag for lag. Dybden er kilden til transformerens kraft.

layers = nn.ModuleList([Block(d) for _ in range(N)])

Før-normalisering eller efter-normalisering

Mange moderne modeller anvender lagnormalisering før hvert underlag i stedet for efter. Prænormalisering giver en mere stabil træning i meget dybe stakke.

Brug det indbyggede

PyTorch giver dig nn.TransformerEncoderLayer og nn.TransformerEncoder, så du kan samle en komplet stak på blot et par linjer.

layer = nn.TransformerEncoderLayer(d_model, nhead)
enc = nn.TransformerEncoder(layer, num_layers=6)

Hurtigt tjek

Lad os gennemgå delene i en encoderblok.

Opsummering

Du samlede en encoderblok: opmærksomhed, residualforbindelse, normalisering, feedforward, residualforbindelse, normalisering. Stak den i dybden, så har du en transformer. Fantastisk arbejde!

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “Stak en Transformer-encoderblok” gratis?

Ja — hele teksten til “Stak en Transformer-encoderblok” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Deep Learning Academy-kurset, skal du opgradere til CoddyKit PRO. Deep Learning Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Stak en Transformer-encoderblok”?

Attention plus feedforward og normer. Du øver dig i Deep Learning Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Deep Learning Academy?

Der kræves ingen tidligere erfaring. Deep Learning Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.

Hvor lang tid tager lektionen “Stak en Transformer-encoderblok”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Deep Learning Academy-lektion?

Ja. Alle Deep Learning Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Self-attention: Query, key og value
  2. Scaled dot-product og multi-head
  3. Positional encoding til rækkefølge
  4. Stak en Transformer-encoderblok
← Tilbage til Deep Learning Academy