Sigmoid i Tanh: sprowadzanie do zakresu
Poznać ograniczone wyniki i pułapkę zanikającego gradientu
Sigmoid i Tanh: sprowadzanie do zakresu to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Aktywacje ściskające
Niektóre funkcje aktywacji ściskają dowolne dane wejściowe do ustalonego zakresu. Dwa klasyczne przykłady to sigmoid i tanh; obie łagodnie przyciągają duże liczby do środka. 🤏
Zakres funkcji sigmoid
Sigmoid odwzorowuje każdą wartość na otwarty przedział od 0 do 1. Dzięki temu jej wynik można naturalnie odczytywać jako prawdopodobieństwo.
import torch
y = torch.sigmoid(x) # outputs between 0 and 1Krzywa w kształcie litery S
Sigmoid ma gładki kształt litery S: w pobliżu zera zmienia się szybko, ale daleko od niego się spłaszcza. Duże dane wejściowe są odwzorowywane na niemal tę samą wartość.
Zakres funkcji tanh
Tanh jest kuzynką sigmoid, ale ściska dane wejściowe do zakresu od minus 1 do plus 1, z punktem środkowym dokładnie w zerze.
y = torch.tanh(x) # outputs between -1 and 1Dlaczego wyśrodkowanie pomaga
Ponieważ tanh jest wyśrodkowana względem zera, jej wyniki równoważą się wokół zera. W warstwach ukrytych często zapewnia to płynniejsze i szybsze uczenie niż sigmoid.
Płaskie końce
Na krańcach obie krzywe niemal się spłaszczają. Płaski obszar oznacza małe nachylenie, a małe nachylenie oznacza mały gradient.
Zanikające gradienty
Gdy gradienty zbliżają się do zera, wczesne warstwy prawie się nie aktualizują. Ta pułapka zanikającego gradientu zatrzymuje uczenie głębokich sieci. 😴
Dlaczego ReLU zdominowała rynek
Problem zanikających gradientów jest właśnie powodem, dla którego ReLU zastąpiła sigmoid i tanh w większości warstw ukrytych. ReLU zachowuje zdrowy gradient dla wartości dodatnich.
Gdzie sigmoid nadal wygrywa
Sigmoid pozostaje przydatna na wyjściu klasyfikatora binarnego, gdy rzeczywiście potrzebne jest pojedyncze prawdopodobieństwo między 0 a 1.
Gdzie tanh nadal wygrywa
Tanh nadal występuje wewnątrz komórek rekurencyjnych, takich jak LSTM, gdzie jej ograniczone do przedziału i wyśrodkowane wokół zera wyjście pomaga utrzymać stabilny stan ukryty.
Rozważny wybór
Zasada praktyczna: należy unikać sigmoid i tanh w głębokich stosach warstw ukrytych, ale zachować sigmoid dla pojedynczego wyjścia reprezentującego prawdopodobieństwo. Narzędzie należy dopasować do zadania.
Szybkie sprawdzenie
Proszę przypomnieć sobie, co dzieje się na płaskich odcinkach tych krzywych.
Podsumowanie
Sigmoid sprowadza wartości do przedziału od 0 do 1, a tanh do przedziału od -1 do 1. Ich płaskie odcinki powodują zanikające gradienty, dlatego należy używać ich w wyjściach i specjalnych komórkach. 🎯
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Sigmoid i Tanh: sprowadzanie do zakresu” jest bezpłatna?
Tak — pełny tekst „Sigmoid i Tanh: sprowadzanie do zakresu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Sigmoid i Tanh: sprowadzanie do zakresu”?
Poznać ograniczone wyniki i pułapkę zanikającego gradientu Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?
Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.
Ile czasu zajmuje lekcja „Sigmoid i Tanh: sprowadzanie do zakresu”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?
Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego nieliniowość odblokowuje prawdziwą moc
- ReLU oraz jej odmiany Leaky ReLU i GELU
- Sigmoid i Tanh: sprowadzanie do zakresu
- Softmax dla prawdopodobieństw