ReLU dan Kerabatnya yang Leaky serta GELU
Aktivasi bawaan dan variasi modernnya
ReLU dan Kerabatnya yang Leaky serta GELU adalah pelajaran Deep Learning Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Deep Learning Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Deep Learning Academy mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Meet ReLU
The most popular activation is ReLU: it keeps positive values and turns every negative one into zero. Simple and fast. ⚡
import torch.nn.functional as F
y = F.relu(x) # max(0, x), elementwiseWhy It Caught On
ReLU is cheap to compute and its gradient is a clean 1 for positives. That keeps signals flowing and makes deep nets train quickly.
The Math
ReLU is just max(0, x). Positive inputs pass straight through; negatives flatten to zero. That single hinge is the whole trick.
The Dying ReLU Problem
If a neuron always outputs zero, its gradient is zero too, so it stops learning forever. We call this a dead neuron. 💀
Leaky ReLU to the Rescue
Leaky ReLU lets a tiny slope through for negatives instead of a hard zero. That small leak keeps dead neurons alive.
y = F.leaky_relu(x, negative_slope=0.01)Parametric ReLU
PReLU goes further: it learns the negative slope during training instead of fixing it. The network tunes the leak itself.
Meet GELU
GELU smooths the ReLU corner into a soft curve. It gates inputs by how likely they are to be useful, not with a hard cutoff.
y = F.gelu(x)Why Transformers Love GELU
Modern models like transformers favor GELU because its smooth shape gives gentler gradients. That often means steadier training. 🤖
SiLU and Friends
SiLU, also called Swish, multiplies the input by its own sigmoid. Like GELU, it is smooth and frequently edges out plain ReLU.
A Sensible Default
Start with ReLU for hidden layers; it is fast and reliable. Reach for Leaky ReLU or GELU only if you see dead neurons or want extra smoothness.
Use It as a Layer
You can drop these in as modules inside a model, not just as functions. That makes them easy to chain in nn.Sequential.
import torch.nn as nn
net = nn.Sequential(nn.Linear(4, 8), nn.ReLU())Quick Check
Think about a neuron that always lands in the negative zone.
Recap
ReLU is the fast default, but it can let neurons die. Leaky ReLU, PReLU, and GELU smooth or leak the negatives to keep learning healthy. 🌟
Pertanyaan yang Sering Diajukan
Apakah pelajaran “ReLU dan Kerabatnya yang Leaky serta GELU” gratis?
Ya — teks lengkap “ReLU dan Kerabatnya yang Leaky serta GELU” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Deep Learning Academy, upgrade ke CoddyKit PRO. Kursus Deep Learning Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “ReLU dan Kerabatnya yang Leaky serta GELU”?
Aktivasi bawaan dan variasi modernnya Kamu berlatih Deep Learning Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Deep Learning Academy?
Tidak diperlukan pengalaman sebelumnya. Deep Learning Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “ReLU dan Kerabatnya yang Leaky serta GELU” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Deep Learning Academy ini?
Ya. Setiap pelajaran Deep Learning Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Mengapa Nonlinearitas Membuka Kekuatan Nyata
- ReLU dan Kerabatnya yang Leaky serta GELU
- Sigmoid dan Tanh: Memampatkan ke Rentang Tertentu
- Softmax untuk Probabilitas