Deep Learning Academy · Lekcja

Sigmoid i Tanh: sprowadzanie do zakresu

Poznać ograniczone wyniki i pułapkę zanikającego gradientu

Lekcja 3 z 413 kroki

Sigmoid i Tanh: sprowadzanie do zakresu to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.

Aktywacje ściskające

Niektóre funkcje aktywacji ściskają dowolne dane wejściowe do ustalonego zakresu. Dwa klasyczne przykłady to sigmoid i tanh; obie łagodnie przyciągają duże liczby do środka. 🤏

Zakres funkcji sigmoid

Sigmoid odwzorowuje każdą wartość na otwarty przedział od 0 do 1. Dzięki temu jej wynik można naturalnie odczytywać jako prawdopodobieństwo.

import torch
y = torch.sigmoid(x)   # outputs between 0 and 1

Krzywa w kształcie litery S

Sigmoid ma gładki kształt litery S: w pobliżu zera zmienia się szybko, ale daleko od niego się spłaszcza. Duże dane wejściowe są odwzorowywane na niemal tę samą wartość.

Zakres funkcji tanh

Tanh jest kuzynką sigmoid, ale ściska dane wejściowe do zakresu od minus 1 do plus 1, z punktem środkowym dokładnie w zerze.

y = torch.tanh(x)   # outputs between -1 and 1

Dlaczego wyśrodkowanie pomaga

Ponieważ tanh jest wyśrodkowana względem zera, jej wyniki równoważą się wokół zera. W warstwach ukrytych często zapewnia to płynniejsze i szybsze uczenie niż sigmoid.

Płaskie końce

Na krańcach obie krzywe niemal się spłaszczają. Płaski obszar oznacza małe nachylenie, a małe nachylenie oznacza mały gradient.

Zanikające gradienty

Gdy gradienty zbliżają się do zera, wczesne warstwy prawie się nie aktualizują. Ta pułapka zanikającego gradientu zatrzymuje uczenie głębokich sieci. 😴

Dlaczego ReLU zdominowała rynek

Problem zanikających gradientów jest właśnie powodem, dla którego ReLU zastąpiła sigmoid i tanh w większości warstw ukrytych. ReLU zachowuje zdrowy gradient dla wartości dodatnich.

Gdzie sigmoid nadal wygrywa

Sigmoid pozostaje przydatna na wyjściu klasyfikatora binarnego, gdy rzeczywiście potrzebne jest pojedyncze prawdopodobieństwo między 0 a 1.

Gdzie tanh nadal wygrywa

Tanh nadal występuje wewnątrz komórek rekurencyjnych, takich jak LSTM, gdzie jej ograniczone do przedziału i wyśrodkowane wokół zera wyjście pomaga utrzymać stabilny stan ukryty.

Rozważny wybór

Zasada praktyczna: należy unikać sigmoid i tanh w głębokich stosach warstw ukrytych, ale zachować sigmoid dla pojedynczego wyjścia reprezentującego prawdopodobieństwo. Narzędzie należy dopasować do zadania.

Szybkie sprawdzenie

Proszę przypomnieć sobie, co dzieje się na płaskich odcinkach tych krzywych.

Podsumowanie

Sigmoid sprowadza wartości do przedziału od 0 do 1, a tanh do przedziału od -1 do 1. Ich płaskie odcinki powodują zanikające gradienty, dlatego należy używać ich w wyjściach i specjalnych komórkach. 🎯

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Sigmoid i Tanh: sprowadzanie do zakresu” jest bezpłatna?

Tak — pełny tekst „Sigmoid i Tanh: sprowadzanie do zakresu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Sigmoid i Tanh: sprowadzanie do zakresu”?

Poznać ograniczone wyniki i pułapkę zanikającego gradientu Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?

Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Sigmoid i Tanh: sprowadzanie do zakresu”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?

Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego nieliniowość odblokowuje prawdziwą moc
  2. ReLU oraz jej odmiany Leaky ReLU i GELU
  3. Sigmoid i Tanh: sprowadzanie do zakresu
  4. Softmax dla prawdopodobieństw
← Powrót do Deep Learning Academy