AI Engineering Academy · Lekcja

Transformery i mechanizm uwagi prostym językiem

Uczestnicy poznają architekturę transformera, analizując, jak mechanizmy uwagi pozwalają modelom koncentrować się na istotnym kontekście bez konieczności rozumienia matematycznych podstaw.

Lekcja 2 z 413 kroki

Transformery i mechanizm uwagi prostym językiem to bezpłatna lekcja AI Engineering Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Engineering Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Engineering Academy zawiera 4 lekcji w sumie.

Główny problem: zależności dalekiego zasięgu

W zdaniu „trofeum nie zmieściło się w torbie, ponieważ ono było za duże” — do czego odnosi się „ono”? Starsze modele gubiły się w długich zdaniach. To właśnie problem zależności dalekiego zasięgu.

Mechanizm uwagi jako ważony wybór

Mechanizm uwagi pozwala modelowi określić, które słowa są najważniejsze dla każdego słowa — podobnie jak zaznaczanie kluczowych fragmentów tekstu zamiast traktowania wszystkich słów jednakowo.

Zapytania, klucze i wartości

Mechanizm uwagi działa jak wyszukiwanie: każde słowo wysyła Query, porównuje je z każdym Key i pobiera najbardziej odpowiednie Values. Poniższy kod pokazuje główną ideę.

# Simplified self-attention in pseudocode
import numpy as np

def scaled_dot_product_attention(Q, K, V):
    d_k = Q.shape[-1]  # dimension of keys
    scores = Q @ K.T / np.sqrt(d_k)  # scale to prevent vanishing gradients
    weights = np.exp(scores) / np.sum(np.exp(scores), axis=-1, keepdims=True)  # softmax
    output = weights @ V  # weighted sum of values
    return output

Uwaga wielogłowicowa: wiele perspektyw

Jedna głowica uwagi wychwytuje jeden rodzaj zależności. Uwaga wielogłowicowa uruchamia wiele głowic równolegle, dzięki czemu model jednocześnie analizuje słowa z kilku perspektyw.

Kodowanie pozycyjne: dodawanie kolejności słów

Sam mechanizm uwagi ignoruje kolejność słów — „pies gryzie człowieka” wygląda tak samo jak „człowiek gryzie psa”. Kodowanie pozycyjne dodaje informację o pozycji, dzięki czemu kolejność nie zostaje utracona.

Warstwy feed-forward po mechanizmie uwagi

Po przekazaniu kontekstu przez mechanizm uwagi sieć feed-forward przetwarza każde słowo niezależnie. Co ciekawe, znaczna część wiedzy faktograficznej modelu wydaje się znajdować właśnie tutaj.

Modele wyłącznie enkoderowe a wyłącznie dekoderowe

Modele typu BERT, wyłącznie enkoderowe, odczytują cały tekst jednocześnie, aby go zrozumieć. Modele typu GPT, wyłącznie dekoderowe, odczytują tekst od lewej do prawej, aby go generować — tak działa ChatGPT.

Warstwowe układanie i głębokość

Nowoczesne LLM-y składają się z dziesiątek bloków Transformer. Każda warstwa udoskonala wynik poprzedniej — wcześniejsze wychwytują gramatykę, a głębsze zajmują się rozumowaniem. Większa głębokość oznacza więcej etapów przetwarzania.

Połączenia rezydualne i normalizacja warstw

Układanie wielu warstw jest trudne. Połączenia rezydualne i normalizacja warstw stabilizują sygnał, dzięki czemu głębokie modele mogą być niezawodnie trenowane nawet przy ponad 100 warstwach.

Dlaczego mechanizm uwagi tak dobrze się skaluje

Mechanizm uwagi łatwo uruchamiać równolegle, więc większa liczba procesorów GPU oznacza szybszy trening. Właśnie tak badacze trenowali modele na ogromnych zbiorach danych i odkryli słynne prawa skalowania.

Flash Attention i współczesne optymalizacje

Długie dane wejściowe sprawiają, że standardowy mechanizm uwagi zużywa bardzo dużo pamięci. FlashAttention oblicza ten sam wynik znacznie wydajniej, dzięki czemu duże okna kontekstu stają się praktyczne.

Szybki test

Sprawdź swoją wiedzę na temat zagadnień inżynierii AI z tej lekcji.

Podsumowanie lekcji

Podsumowanie: self-attention łączy każde słowo z każdym innym, uwaga wielogłowicowa wychwytuje wiele zależności jednocześnie, a połączenia rezydualne wraz z normalizacją pozwalają budować głębokie modele. Dalej: jak trenuje się LLM-y.

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Transformery i mechanizm uwagi prostym językiem” jest bezpłatna?

Tak — pełny tekst „Transformery i mechanizm uwagi prostym językiem” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Engineering Academy, przejdź na CoddyKit PRO. Kurs AI Engineering Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Transformery i mechanizm uwagi prostym językiem”?

Uczestnicy poznają architekturę transformera, analizując, jak mechanizmy uwagi pozwalają modelom koncentrować się na istotnym kontekście bez konieczności rozumienia matematycznych podstaw. Ćwiczysz AI Engineering Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Engineering Academy?

Nie wymagamy żadnego doświadczenia. AI Engineering Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Transformery i mechanizm uwagi prostym językiem”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Engineering Academy?

Tak. Każda lekcja AI Engineering Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Od autouzupełniania do ChatGPT
  2. Transformery i mechanizm uwagi prostym językiem
  3. Jak trenuje się LLM-y
  4. Możliwości i ograniczenia LLM-ów
← Powrót do AI Engineering Academy