Tokenisasi dan Bangun Kosakata
Petakan teks ke ID bilangan bulat
Tokenisasi dan Bangun Kosakata adalah pelajaran Deep Learning Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Deep Learning Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Deep Learning Academy mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Networks Only Eat Numbers
A neural net cannot read raw letters. Before any learning happens, you must turn text into numbers the model can crunch. 🔢
First Step: Tokenize
To tokenize means to split text into small pieces called tokens. The simplest choice is to split a sentence on spaces into words.
text = "I love deep learning"
tokens = text.split()
# ["I", "love", "deep", "learning"]Tokens Can Be Smaller
A token need not be a whole word. It can be a character or a sub-word piece, which helps the model handle rare or unseen words.
Build a Vocabulary
A vocabulary is the full set of unique tokens your model knows. You collect every distinct token across your training text.
Give Each Token an Id
Each unique token gets one integer id. This mapping from token to id is how words become numbers the network can index.
vocab = {"i": 0, "love": 1, "deep": 2, "learning": 3}Encode a Sentence
To encode text, you look up each token in the vocabulary and replace it with its id, producing a list of integers.
ids = [vocab[t] for t in ["i", "love", "deep"]]
# [0, 1, 2]Handle Unknown Words
Some tokens at test time were never seen in training. Map them to a special unknown token so the model still gets a valid id.
unk_id = vocab.get("dragons", vocab["<unk>"])Special Tokens Help
Add special tokens like padding, start, and end markers. They give the model structure beyond the plain words themselves.
Lowercase and Clean
Normalizing text by lowercasing and stripping punctuation shrinks the vocabulary so Cat and cat share a single id.
Limit the Vocabulary Size
Real corpora have huge vocabularies. Keep only the most frequent tokens to control the vocab size; the rest become unknown.
Now Text Is a Tensor
Once encoded, a sentence is a list of ids you can wrap in a tensor. The pipeline from raw text to model input is complete.
import torch
ids = torch.tensor([0, 1, 2, 3])Quick Check
What does building a vocabulary give every unique token?
Recap
You split text into tokens, gather the unique ones into a vocabulary, and map each to an integer id so text becomes numbers. ✅
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Tokenisasi dan Bangun Kosakata” gratis?
Ya — teks lengkap “Tokenisasi dan Bangun Kosakata” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Deep Learning Academy, upgrade ke CoddyKit PRO. Kursus Deep Learning Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Tokenisasi dan Bangun Kosakata”?
Petakan teks ke ID bilangan bulat Kamu berlatih Deep Learning Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai Deep Learning Academy?
Tidak diperlukan pengalaman sebelumnya. Deep Learning Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Tokenisasi dan Bangun Kosakata” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran Deep Learning Academy ini?
Ya. Setiap pelajaran Deep Learning Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Tokenisasi dan Bangun Kosakata
- nn.Embedding: Vektor Kata yang Dapat Dipelajari
- Mengapa Embedding Menangkap Makna
- Latih Pengklasifikasi Teks