0Pricing
Deep Learning Academy · Pelajaran

Susun Blok Encoder Transformer

Perhatian ditambah jaringan feedforward dan normalisasi

Susun Blok Encoder Transformer adalah pelajaran Deep Learning Academy gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Deep Learning Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Deep Learning Academy mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

The Building Block

A transformer is just one encoder block repeated. Learn the block and you understand the whole tower, from tiny models to giant ones.

Two Sub-Layers

Each block has two parts: a multi-head attention sub-layer, then a small feedforward network. Both wrapped with residuals and normalization.

Attention First

The block starts with self-attention, letting every token mix in context from the rest of the sequence before any further processing.

attn_out, _ = self.attn(x, x, x)

The Residual Connection

A residual adds the sub-layer's input back to its output. This shortcut lets gradients flow and keeps deep stacks trainable.

x = x + attn_out

Layer Normalization

After adding the residual, layer norm rescales each token's features to a stable distribution, steadying training across layers.

x = self.norm1(x)

The Feedforward Net

Next comes a position-wise feedforward network: expand to a wider hidden size, apply a nonlinearity, then project back down.

ff = nn.Sequential(nn.Linear(d, 4*d), nn.GELU(), nn.Linear(4*d, d))

Per-Token Processing

The feedforward layer treats each token independently. Attention shared information; this step refines each token on its own.

Second Residual and Norm

The feedforward output gets the same treatment: a residual add plus another layer norm, finishing the block.

x = self.norm2(x + ff(x))

Stack Them Deep

Stack many identical blocks and the model builds richer representations layer by layer. Depth is where transformer power comes from.

layers = nn.ModuleList([Block(d) for _ in range(N)])

Pre-Norm vs Post-Norm

Many modern models apply layer norm before each sub-layer instead of after. Pre-norm trains more stably in very deep stacks.

Use the Built-in

PyTorch gives you nn.TransformerEncoderLayer and nn.TransformerEncoder, so you can assemble a full stack in just a couple of lines.

layer = nn.TransformerEncoderLayer(d_model, nhead)
enc = nn.TransformerEncoder(layer, num_layers=6)

Quick Check

Let's review the parts of an encoder block.

Recap

You assembled an encoder block: attention, residual, norm, feedforward, residual, norm. Stack it deep and you have a transformer. Amazing work!

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Susun Blok Encoder Transformer” gratis?

Ya — teks lengkap “Susun Blok Encoder Transformer” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Deep Learning Academy, upgrade ke CoddyKit PRO. Kursus Deep Learning Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Susun Blok Encoder Transformer”?

Perhatian ditambah jaringan feedforward dan normalisasi Kamu berlatih Deep Learning Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Deep Learning Academy?

Tidak diperlukan pengalaman sebelumnya. Deep Learning Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Susun Blok Encoder Transformer” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Deep Learning Academy ini?

Ya. Setiap pelajaran Deep Learning Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Perhatian Diri: Query, Key, dan Value
  2. Produk Titik Berskala dan Multi-Head
  3. Pengodean Posisi untuk Urutan
  4. Susun Blok Encoder Transformer
← Kembali ke Deep Learning Academy