Tokenizacja i budowanie słownika
Mapować tekst na identyfikatory całkowite
Tokenizacja i budowanie słownika to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Sieci przyjmują tylko liczby
Sieć neuronowa nie potrafi odczytać surowych liter. Zanim rozpocznie się uczenie, trzeba przekształcić tekst w liczby, które model może przetwarzać. 🔢
Pierwszy krok: tokenizacja
Tokenizacja oznacza podział tekstu na małe elementy zwane tokenami. Najprościej podzielić zdanie na słowa według spacji.
text = "I love deep learning"
tokens = text.split()
# ["I", "love", "deep", "learning"]Tokeny mogą być mniejsze
Token nie musi być całym słowem. Może nim być znak lub fragment słowa, co pomaga modelowi obsługiwać rzadkie lub nieznane słowa.
Budowanie słownika
Słownik to pełny zbiór unikatowych tokenów znanych modelowi. Należy zebrać każdy różny token występujący w tekście treningowym.
Nadawanie każdemu tokenowi identyfikatora
Każdy unikatowy token otrzymuje jeden całkowity identyfikator. To przypisanie tokenu do identyfikatora pozwala zamienić słowa na liczby, które sieć może indeksować.
vocab = {"i": 0, "love": 1, "deep": 2, "learning": 3}Kodowanie zdania
Aby zakodować tekst, należy wyszukać każdy token w słowniku i zastąpić go jego identyfikatorem, uzyskując listę liczb całkowitych.
ids = [vocab[t] for t in ["i", "love", "deep"]]
# [0, 1, 2]Obsługa nieznanych słów
Niektóre tokeny występujące podczas testowania nie pojawiły się wcześniej w danych treningowych. Należy przypisać je do specjalnego tokenu nieznanego, aby model nadal otrzymał prawidłowy identyfikator.
unk_id = vocab.get("dragons", vocab["<unk>"])Tokeny specjalne pomagają
Należy dodać tokeny specjalne, takie jak dopełnienie oraz znaczniki początku i końca. Dostarczają one modelowi struktury wykraczającej poza same zwykłe słowa.
Zamiana na małe litery i czyszczenie
Normalizacja tekstu przez zamianę na małe litery i usunięcie znaków interpunkcyjnych zmniejsza słownik, dzięki czemu Cat i cat współdzielą jeden identyfikator.
Ograniczanie rozmiaru słownika
Rzeczywiste korpusy mają ogromne słowniki. Należy zachować tylko najczęściej występujące tokeny, aby kontrolować rozmiar słownika; pozostałe staną się nieznane.
Tekst jest teraz tensorem
Po zakodowaniu zdanie jest listą identyfikatorów, którą można opakować w tensor. Potok od surowego tekstu do wejścia modelu jest ukończony.
import torch
ids = torch.tensor([0, 1, 2, 3])Szybkie sprawdzenie
Co budowanie słownika zapewnia każdemu unikatowemu tokenowi?
Podsumowanie
Tekst jest dzielony na tokeny, unikatowe tokeny są zbierane w słowniku, a każdy z nich otrzymuje całkowity identyfikator, dzięki czemu tekst staje się liczbami. ✅
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Tokenizacja i budowanie słownika” jest bezpłatna?
Tak — pełny tekst „Tokenizacja i budowanie słownika” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Tokenizacja i budowanie słownika”?
Mapować tekst na identyfikatory całkowite Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?
Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Tokenizacja i budowanie słownika”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?
Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Tokenizacja i budowanie słownika
- nn.Embedding: uczone wektory słów
- Dlaczego embeddingi przechwytują znaczenie
- Wytrenować klasyfikator tekstu