Deep Learning Academy · Lekcja

ReLU oraz jej odmiany Leaky ReLU i GELU

Poznać domyślną funkcję aktywacji i jej współczesne warianty

Lekcja 2 z 413 kroki

ReLU oraz jej odmiany Leaky ReLU i GELU to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.

Poznaj ReLU

Najpopularniejszą funkcją aktywacji jest ReLU: zachowuje wartości dodatnie, a każdą ujemną zamienia na zero. Prosta i szybka. ⚡

import torch.nn.functional as F
y = F.relu(x)   # max(0, x), elementwise

Dlaczego zyskała popularność

ReLU jest tania obliczeniowo, a jej gradient dla wartości dodatnich wynosi dokładnie 1. Dzięki temu sygnały mogą płynąć, a głębokie sieci uczą się szybko.

Matematyka

ReLU to po prostu max(0, x). Dodatnie dane wejściowe przechodzą bez zmian, a ujemne spłaszczają się do zera. Cała sztuczka sprowadza się do tego jednego załamania.

Problem umierającego ReLU

Jeśli neuron zawsze zwraca zero, jego gradient również wynosi zero, więc na zawsze przestaje się uczyć. Taki neuron nazywamy martwym. 💀

Leaky ReLU na ratunek

Leaky ReLU przepuszcza dla wartości ujemnych niewielkie nachylenie zamiast twardego zera. Ten mały przeciek utrzymuje martwe neurony przy życiu.

y = F.leaky_relu(x, negative_slope=0.01)

Parametryczne ReLU

PReLU idzie o krok dalej: podczas uczenia uczy się ujemnego nachylenia zamiast przyjmować je na stałe. Sieć sama dostraja wielkość przecieku.

Poznaj GELU

GELU wygładza narożnik ReLU, zamieniając go w łagodną krzywą. Przepuszcza dane wejściowe zależnie od tego, jak prawdopodobne jest, że okażą się użyteczne, zamiast stosować twarde odcięcie.

y = F.gelu(x)

Dlaczego transformatory lubią GELU

Współczesne modele, takie jak transformatory, preferują GELU, ponieważ jej gładki kształt zapewnia łagodniejsze gradienty. Często oznacza to stabilniejsze uczenie. 🤖

SiLU i podobne funkcje

SiLU, nazywana także funkcją Swish, mnoży dane wejściowe przez ich własną funkcję sigmoidalną. Podobnie jak GELU jest gładka i często przewyższa zwykłą ReLU.

Rozsądne ustawienie domyślne

Na początek warto użyć ReLU w warstwach ukrytych — jest szybka i niezawodna. Po Leaky ReLU lub GELU należy sięgać tylko wtedy, gdy pojawiają się martwe neurony albo potrzebne jest większe wygładzenie.

Użyj jej jako warstwy

Można dodawać te funkcje jako moduły wewnątrz modelu, a nie tylko jako funkcje. Dzięki temu łatwo łączyć je w nn.Sequential.

import torch.nn as nn
net = nn.Sequential(nn.Linear(4, 8), nn.ReLU())

Szybkie sprawdzenie

Zastanów się nad neuronem, który zawsze trafia do strefy wartości ujemnych.

Podsumowanie

ReLU jest szybkim ustawieniem domyślnym, ale może doprowadzić do obumarcia neuronów. Leaky ReLU, PReLU i GELU wygładzają wartości ujemne albo przepuszczają ich część, aby uczenie przebiegało prawidłowo. 🌟

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „ReLU oraz jej odmiany Leaky ReLU i GELU” jest bezpłatna?

Tak — pełny tekst „ReLU oraz jej odmiany Leaky ReLU i GELU” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „ReLU oraz jej odmiany Leaky ReLU i GELU”?

Poznać domyślną funkcję aktywacji i jej współczesne warianty Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?

Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „ReLU oraz jej odmiany Leaky ReLU i GELU”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?

Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego nieliniowość odblokowuje prawdziwą moc
  2. ReLU oraz jej odmiany Leaky ReLU i GELU
  3. Sigmoid i Tanh: sprowadzanie do zakresu
  4. Softmax dla prawdopodobieństw
← Powrót do Deep Learning Academy