Für Transformer-Modelle tokenisieren
Subwords, Padding und Attention Masks
Für Transformer-Modelle tokenisieren ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
Tokens Come First
Before a transformer can learn anything, your text must become numbers. That conversion job belongs to the tokenizer.
Match the Model
Always load the tokenizer that was trained with your model. A mismatched vocabulary produces garbage ids the model never saw.
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")Subword Pieces
Modern tokenizers split rare words into smaller chunks called subwords, so even unknown text stays representable.
print(tok.tokenize("tokenization"))Why Subwords Win
Subwords keep the vocabulary small while still handling typos and new words. The model rarely meets a true unknown token.
From Tokens to Ids
Each subword maps to an integer id. Calling the tokenizer on text returns those ids ready for the model.
enc = tok("Fine-tuning is fun")
print(enc["input_ids"])Special Tokens
Tokenizers add markers like CLS and SEP so the model knows where a sequence starts and ends. These are the special tokens.
Padding to Equal Length
Batches need same-length rows, so shorter texts get filler tokens. This step is called padding.
tok(texts, padding=True)Truncation for Long Text
Models cap input length, so very long text is cut to fit. Enabling truncation keeps every example within the limit.
tok(texts, truncation=True, max_length=128)The Attention Mask
An attention mask marks real tokens as 1 and padding as 0, so the model ignores the filler positions.
print(enc["attention_mask"])Return Tensors
Ask the tokenizer for framework tensors directly so the output drops straight into training without extra conversion.
tok("hello", return_tensors="pt")Decode Back to Text
To read predictions, run ids through decode and the tokenizer rebuilds the original text, special tokens stripped.
print(tok.decode(enc["input_ids"]))Quick Check
What is the job of the attention mask during batching?
Recap
Tokenizers turn text into subword ids, add special tokens, then handle padding, truncation, and the attention mask for clean batches. ✅
Häufig gestellte Fragen
Ist die Lektion „Für Transformer-Modelle tokenisieren“ kostenlos?
Ja — der vollständige Text von „Für Transformer-Modelle tokenisieren“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Für Transformer-Modelle tokenisieren“?
Subwords, Padding und Attention Masks Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um NLP Academy zu starten?
Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Für Transformer-Modelle tokenisieren“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?
Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Rundgang durch die Transformers-Bibliothek
- Für Transformer-Modelle tokenisieren
- Mit der Trainer API feinabstimmen
- Ihr Modell evaluieren und speichern