Melakukan Tokenisasi untuk Model Transformer
Subkata, padding, dan mask attention
Melakukan Tokenisasi untuk Model Transformer adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.
Token Didahulukan
Sebelum transformer dapat mempelajari sesuatu, teks Anda harus diubah menjadi angka. Tugas konversi itu dilakukan oleh tokenizer.
Sesuaikan dengan Model
Selalu muat tokenizer yang dilatih bersama model Anda. Kosakata yang tidak cocok menghasilkan id yang tidak bermakna dan belum pernah dilihat model.
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")Potongan Subkata
Tokenizer modern memecah kata-kata yang jarang muncul menjadi potongan-potongan lebih kecil yang disebut subkata, sehingga teks yang tidak dikenal pun tetap dapat direpresentasikan.
print(tok.tokenize("tokenization"))Mengapa Subkata Lebih Unggul
Subkata menjaga kosakata tetap kecil sekaligus menangani salah ketik dan kata baru. Model jarang sekali menemukan token yang benar-benar tidak dikenal.
Dari Token ke Id
Setiap subkata dipetakan ke id bilangan bulat. Memanggil tokenizer pada teks akan mengembalikan id tersebut agar siap digunakan model.
enc = tok("Fine-tuning is fun")
print(enc["input_ids"])Token Khusus
Tokenizer menambahkan penanda seperti CLS dan SEP agar model mengetahui tempat urutan dimulai dan berakhir. Token-token ini adalah token khusus.
Mengisi hingga Panjang yang Sama
Kelompok data memerlukan baris dengan panjang yang sama, sehingga teks yang lebih pendek mendapat token pengisi. Langkah ini disebut padding.
tok(texts, padding=True)Pemotongan untuk Teks Panjang
Model membatasi panjang input, sehingga teks yang sangat panjang dipotong agar sesuai. Mengaktifkan truncation memastikan setiap contoh tetap berada dalam batas.
tok(texts, truncation=True, max_length=128)Masker Perhatian
Sebuah masker perhatian menandai token nyata dengan 1 dan padding dengan 0, sehingga model mengabaikan posisi pengisi.
print(enc["attention_mask"])Kembalikan Tensor
Minta tokenizer mengembalikan tensor kerangka kerja secara langsung agar output dapat langsung digunakan dalam pelatihan tanpa konversi tambahan.
tok("hello", return_tensors="pt")Decode Kembali Menjadi Teks
Untuk membaca prediksi, jalankan id melalui decode dan tokenizer akan membangun kembali teks asli dengan token khusus dihapus.
print(tok.decode(enc["input_ids"]))Pemeriksaan Singkat
Apa fungsi masker perhatian selama pengelompokan data?
Ringkasan
Tokenizer mengubah teks menjadi id subkata, menambahkan token khusus, lalu menangani padding, pemotongan, dan masker perhatian untuk menghasilkan kelompok data yang rapi. ✅
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Melakukan Tokenisasi untuk Model Transformer” gratis?
Ya — teks lengkap “Melakukan Tokenisasi untuk Model Transformer” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Melakukan Tokenisasi untuk Model Transformer”?
Subkata, padding, dan mask attention Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai NLP Academy?
Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Melakukan Tokenisasi untuk Model Transformer” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?
Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Tur Pustaka Transformers
- Melakukan Tokenisasi untuk Model Transformer
- Penyetelan Halus dengan API Trainer
- Mengevaluasi dan Menyimpan Model Anda