Self-attention: query, key e value
Permetta a ogni token di osservare tutti gli altri
Self-attention: query, key e value è una lezione Deep Learning Academy gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Deep Learning Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Deep Learning Academy include 4 lezioni in totale.
Token che comunicano
In una sequenza, il significato di una parola dipende dalle altre. La self-attention consente a ogni token di guardare ogni altro token per raccogliere il contesto necessario.
Tre ruoli per ogni token
Ogni token svolge tre ruoli: una query che pone una domanda, una key che risponde e un value che trasporta il contenuto. Tutti derivano dalla stessa parola, usata in tre modi.
La query
La query di un token descrive ciò che sta cercando. La si può vedere come la domanda che questa parola pone sul resto della frase.
La key
Ogni token espone anche una key, un’etichetta che indica ciò che offre. Una query viene confrontata con tutte le key per trovare le corrispondenze migliori.
Il value
Una volta trovata una corrispondenza, il value è l’informazione effettiva che viene trasmessa. Le key decidono quanto, i value decidono che cosa.
Creare Q, K e V
Costruisce query, key e value proiettando l’input attraverso tre livelli lineari appresi. Lo stesso input, tre matrici di pesi diverse.
q = self.W_q(x)
k = self.W_k(x)
v = self.W_v(x)Calcolare il punteggio tramite similarità
Per stabilire quanto una query corrisponde a una key, se ne calcola il prodotto scalare. Un punteggio maggiore significa che i due token sono più rilevanti l’uno per l’altro.
scores = q @ k.transpose(-2, -1)Dai punteggi ai pesi
I punteggi grezzi diventano pesi di attention tramite softmax, così i pesi di ogni query sono positivi e la loro somma su tutte le key è uno.
weights = scores.softmax(dim=-1)Combinare i value
L’output di ogni token è una somma pesata di tutti i value, combinati in base ai pesi dell’attention. I token rilevanti contribuiscono maggiormente.
out = weights @ vPerché è migliore delle RNN
La self-attention collega qualsiasi coppia di token in un solo passaggio, quindi la distanza non conta. Questa visione parallela spiega perché i transformer gestiscono così bene i contesti lunghi.
Appreso, non fisso
Le proiezioni Q, K e V vengono addestrate tramite discesa del gradiente. La rete impara che cosa chiedere, che cosa offrire e che cosa condividere, tutto a partire dai dati.
Verifica rapida
Verifichiamo come l’attention combina i suoi elementi.
Riepilogo
Ha imparato che la self-attention trasforma ogni token in una query, una key e un value, calcola i punteggi delle corrispondenze query-key e combina i value usando pesi ottenuti con softmax. Ottimo lavoro!
Impara Python con un tutor IA — gratis
Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.
- Corsi
- 30
- Lezioni
- 120
Domande Frequenti
La lezione «Self-attention: query, key e value» è gratuita?
Sì — il testo completo di «Self-attention: query, key e value» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Deep Learning Academy, passa a CoddyKit PRO. Il corso Deep Learning Academy include 4 lezioni in totale.
Cosa imparerò in «Self-attention: query, key e value»?
Permetta a ogni token di osservare tutti gli altri Eserciti Deep Learning Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare Deep Learning Academy?
Non è richiesta alcuna esperienza precedente. Deep Learning Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.
Quanto tempo richiede la lezione «Self-attention: query, key e value»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione Deep Learning Academy?
Sì. Ogni lezione Deep Learning Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Self-attention: query, key e value
- Prodotto scalare scalato e multi-head
- Codifica posizionale per l'ordine
- Sovrapporre un blocco encoder Transformer