ReLU oraz jej odmiany Leaky ReLU i GELU
Poznać domyślną funkcję aktywacji i jej współczesne warianty
ReLU oraz jej odmiany Leaky ReLU i GELU to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Poznaj ReLU
Najpopularniejszą funkcją aktywacji jest ReLU: zachowuje wartości dodatnie, a każdą ujemną zamienia na zero. Prosta i szybka. ⚡
import torch.nn.functional as F
y = F.relu(x) # max(0, x), elementwiseDlaczego zyskała popularność
ReLU jest tania obliczeniowo, a jej gradient dla wartości dodatnich wynosi dokładnie 1. Dzięki temu sygnały mogą płynąć, a głębokie sieci uczą się szybko.
Matematyka
ReLU to po prostu max(0, x). Dodatnie dane wejściowe przechodzą bez zmian, a ujemne spłaszczają się do zera. Cała sztuczka sprowadza się do tego jednego załamania.
Problem umierającego ReLU
Jeśli neuron zawsze zwraca zero, jego gradient również wynosi zero, więc na zawsze przestaje się uczyć. Taki neuron nazywamy martwym. 💀
Leaky ReLU na ratunek
Leaky ReLU przepuszcza dla wartości ujemnych niewielkie nachylenie zamiast twardego zera. Ten mały przeciek utrzymuje martwe neurony przy życiu.
y = F.leaky_relu(x, negative_slope=0.01)Parametryczne ReLU
PReLU idzie o krok dalej: podczas uczenia uczy się ujemnego nachylenia zamiast przyjmować je na stałe. Sieć sama dostraja wielkość przecieku.
Poznaj GELU
GELU wygładza narożnik ReLU, zamieniając go w łagodną krzywą. Przepuszcza dane wejściowe zależnie od tego, jak prawdopodobne jest, że okażą się użyteczne, zamiast stosować twarde odcięcie.
y = F.gelu(x)Dlaczego transformatory lubią GELU
Współczesne modele, takie jak transformatory, preferują GELU, ponieważ jej gładki kształt zapewnia łagodniejsze gradienty. Często oznacza to stabilniejsze uczenie. 🤖
SiLU i podobne funkcje
SiLU, nazywana także funkcją Swish, mnoży dane wejściowe przez ich własną funkcję sigmoidalną. Podobnie jak GELU jest gładka i często przewyższa zwykłą ReLU.
Rozsądne ustawienie domyślne
Na początek warto użyć ReLU w warstwach ukrytych — jest szybka i niezawodna. Po Leaky ReLU lub GELU należy sięgać tylko wtedy, gdy pojawiają się martwe neurony albo potrzebne jest większe wygładzenie.
Użyj jej jako warstwy
Można dodawać te funkcje jako moduły wewnątrz modelu, a nie tylko jako funkcje. Dzięki temu łatwo łączyć je w nn.Sequential.
import torch.nn as nn
net = nn.Sequential(nn.Linear(4, 8), nn.ReLU())Szybkie sprawdzenie
Zastanów się nad neuronem, który zawsze trafia do strefy wartości ujemnych.
Podsumowanie
ReLU jest szybkim ustawieniem domyślnym, ale może doprowadzić do obumarcia neuronów. Leaky ReLU, PReLU i GELU wygładzają wartości ujemne albo przepuszczają ich część, aby uczenie przebiegało prawidłowo. 🌟
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „ReLU oraz jej odmiany Leaky ReLU i GELU” jest bezpłatna?
Tak — pełny tekst „ReLU oraz jej odmiany Leaky ReLU i GELU” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „ReLU oraz jej odmiany Leaky ReLU i GELU”?
Poznać domyślną funkcję aktywacji i jej współczesne warianty Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?
Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „ReLU oraz jej odmiany Leaky ReLU i GELU”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?
Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego nieliniowość odblokowuje prawdziwą moc
- ReLU oraz jej odmiany Leaky ReLU i GELU
- Sigmoid i Tanh: sprowadzanie do zakresu
- Softmax dla prawdopodobieństw