Transformer Modelleri için Belirteçlere Ayırma
Alt kelimeler, dolgu ve dikkat maskeleri
Transformer Modelleri için Belirteçlere Ayırma, CoddyKit'te ücretsiz bir NLP Academy dersidir. Bu, 4 dersinin 2. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, NLP Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. NLP Academy kursu toplamda 4 dersten oluşur.
Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.
Tokens Come First
Before a transformer can learn anything, your text must become numbers. That conversion job belongs to the tokenizer.
Match the Model
Always load the tokenizer that was trained with your model. A mismatched vocabulary produces garbage ids the model never saw.
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")Subword Pieces
Modern tokenizers split rare words into smaller chunks called subwords, so even unknown text stays representable.
print(tok.tokenize("tokenization"))Why Subwords Win
Subwords keep the vocabulary small while still handling typos and new words. The model rarely meets a true unknown token.
From Tokens to Ids
Each subword maps to an integer id. Calling the tokenizer on text returns those ids ready for the model.
enc = tok("Fine-tuning is fun")
print(enc["input_ids"])Special Tokens
Tokenizers add markers like CLS and SEP so the model knows where a sequence starts and ends. These are the special tokens.
Padding to Equal Length
Batches need same-length rows, so shorter texts get filler tokens. This step is called padding.
tok(texts, padding=True)Truncation for Long Text
Models cap input length, so very long text is cut to fit. Enabling truncation keeps every example within the limit.
tok(texts, truncation=True, max_length=128)The Attention Mask
An attention mask marks real tokens as 1 and padding as 0, so the model ignores the filler positions.
print(enc["attention_mask"])Return Tensors
Ask the tokenizer for framework tensors directly so the output drops straight into training without extra conversion.
tok("hello", return_tensors="pt")Decode Back to Text
To read predictions, run ids through decode and the tokenizer rebuilds the original text, special tokens stripped.
print(tok.decode(enc["input_ids"]))Quick Check
What is the job of the attention mask during batching?
Recap
Tokenizers turn text into subword ids, add special tokens, then handle padding, truncation, and the attention mask for clean batches. ✅
Sıkça Sorulan Sorular
“Transformer Modelleri için Belirteçlere Ayırma” dersi ücretsiz mi?
Evet — “Transformer Modelleri için Belirteçlere Ayırma” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve NLP Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. NLP Academy kursu toplamda 4 dersten oluşur.
“Transformer Modelleri için Belirteçlere Ayırma” dersinde ne öğreneceğim?
Alt kelimeler, dolgu ve dikkat maskeleri NLP Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
NLP Academy öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te NLP Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 2. dersidir.
“Transformer Modelleri için Belirteçlere Ayırma” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu NLP Academy dersinde kod yazıp çalıştırabilir miyim?
Evet. Her NLP Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Transformers Kütüphanesine Genel Bakış
- Transformer Modelleri için Belirteçlere Ayırma
- Trainer API ile İnce Ayar
- Modelinizi Değerlendirme ve Kaydetme