NLP Academy · Lezione

All'interno del blocco Transformer

Come si integra l'intera architettura

Lezione 4 di 413 passaggi

All'interno del blocco Transformer è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.

Impilare i blocchi

Un Transformer si costruisce impilando lo stesso blocco molte volte. Ogni blocco perfeziona un po' di più la rappresentazione. 🧱

Due sottolivelli principali

Ogni blocco ha due parti: un sottolivello di multi-head attention seguito da una piccola rete feed-forward applicata a ogni posizione.

La rete feed-forward

Il sottolivello feed-forward è composto da due livelli lineari con una non linearità tra loro e processa ogni token in modo indipendente per aumentare la capacità del modello.

h = relu(x @ W1 + b1) @ W2 + b2

Connessioni residuali

Ogni sottolivello avvolge il proprio input in una connessione residuale: somma nuovamente l'input all'output, così i gradienti fluiscono e non si perde alcuna informazione.

out = x + sublayer(x)

Normalizzazione dei livelli

Dopo aver aggiunto il residuo, la normalizzazione del livello ridimensiona i valori. Questo mantiene stabili le attivazioni e accelera l'addestramento.

out = layer_norm(x + sublayer(x))

Blocchi dell'encoder

Una pila di encoder legge l'input e costruisce ricchi vettori di contesto. Usa la self-attention, così ogni token può vedere tutti gli altri.

Blocchi del decoder

Un decoder genera l'output un token alla volta. Aggiunge l'attenzione mascherata e la cross-attention verso l'encoder.

Attenzione mascherata

Durante la generazione, il masking nasconde i token futuri, così il decoder non può sbirciare in anticipo e deve prevedere onestamente la parola successiva.

Cross-attention

La cross-attention permette al decoder di interrogare gli output dell'encoder, collegando ciò che sta scrivendo a ciò che ha letto inizialmente.

La profondità porta potenza

Impilare molti blocchi permette ai primi livelli di individuare schemi semplici e ai livelli successivi di costruire un significato astratto, proprio come nelle reti profonde per la visione.

Encoder, decoder o entrambi

BERT usa solo l'encoder, GPT usa solo il decoder e i modelli di traduzione usano entrambi. Il blocco è l'unità costruttiva condivisa. 🚀

Verifica rapida

Verifichiamo la struttura del blocco.

Riepilogo

Ha assemblato il blocco Transformer: attenzione più feed-forward, racchiuse in connessioni residuali e layer norm, impilate in encoder e decoder. ✨

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «All'interno del blocco Transformer» è gratuita?

Sì — il testo completo di «All'interno del blocco Transformer» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.

Cosa imparerò in «All'interno del blocco Transformer»?

Come si integra l'intera architettura Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare NLP Academy?

Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «All'interno del blocco Transformer»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione NLP Academy?

Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. L'idea dell'attention
  2. Self-attention passo dopo passo
  3. Multi-head attention e posizioni
  4. All'interno del blocco Transformer
← Torna a NLP Academy