Deep Learning Academy · Lekcja

Tokenizacja i budowanie słownika

Mapować tekst na identyfikatory całkowite

Lekcja 1 z 413 kroki

Tokenizacja i budowanie słownika to bezpłatna lekcja Deep Learning Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Deep Learning Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.

Sieci przyjmują tylko liczby

Sieć neuronowa nie potrafi odczytać surowych liter. Zanim rozpocznie się uczenie, trzeba przekształcić tekst w liczby, które model może przetwarzać. 🔢

Pierwszy krok: tokenizacja

Tokenizacja oznacza podział tekstu na małe elementy zwane tokenami. Najprościej podzielić zdanie na słowa według spacji.

text = "I love deep learning"
tokens = text.split()
# ["I", "love", "deep", "learning"]

Tokeny mogą być mniejsze

Token nie musi być całym słowem. Może nim być znak lub fragment słowa, co pomaga modelowi obsługiwać rzadkie lub nieznane słowa.

Budowanie słownika

Słownik to pełny zbiór unikatowych tokenów znanych modelowi. Należy zebrać każdy różny token występujący w tekście treningowym.

Nadawanie każdemu tokenowi identyfikatora

Każdy unikatowy token otrzymuje jeden całkowity identyfikator. To przypisanie tokenu do identyfikatora pozwala zamienić słowa na liczby, które sieć może indeksować.

vocab = {"i": 0, "love": 1, "deep": 2, "learning": 3}

Kodowanie zdania

Aby zakodować tekst, należy wyszukać każdy token w słowniku i zastąpić go jego identyfikatorem, uzyskując listę liczb całkowitych.

ids = [vocab[t] for t in ["i", "love", "deep"]]
# [0, 1, 2]

Obsługa nieznanych słów

Niektóre tokeny występujące podczas testowania nie pojawiły się wcześniej w danych treningowych. Należy przypisać je do specjalnego tokenu nieznanego, aby model nadal otrzymał prawidłowy identyfikator.

unk_id = vocab.get("dragons", vocab["<unk>"])

Tokeny specjalne pomagają

Należy dodać tokeny specjalne, takie jak dopełnienie oraz znaczniki początku i końca. Dostarczają one modelowi struktury wykraczającej poza same zwykłe słowa.

Zamiana na małe litery i czyszczenie

Normalizacja tekstu przez zamianę na małe litery i usunięcie znaków interpunkcyjnych zmniejsza słownik, dzięki czemu Cat i cat współdzielą jeden identyfikator.

Ograniczanie rozmiaru słownika

Rzeczywiste korpusy mają ogromne słowniki. Należy zachować tylko najczęściej występujące tokeny, aby kontrolować rozmiar słownika; pozostałe staną się nieznane.

Tekst jest teraz tensorem

Po zakodowaniu zdanie jest listą identyfikatorów, którą można opakować w tensor. Potok od surowego tekstu do wejścia modelu jest ukończony.

import torch
ids = torch.tensor([0, 1, 2, 3])

Szybkie sprawdzenie

Co budowanie słownika zapewnia każdemu unikatowemu tokenowi?

Podsumowanie

Tekst jest dzielony na tokeny, unikatowe tokeny są zbierane w słowniku, a każdy z nich otrzymuje całkowity identyfikator, dzięki czemu tekst staje się liczbami. ✅

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Tokenizacja i budowanie słownika” jest bezpłatna?

Tak — pełny tekst „Tokenizacja i budowanie słownika” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Deep Learning Academy, przejdź na CoddyKit PRO. Kurs Deep Learning Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Tokenizacja i budowanie słownika”?

Mapować tekst na identyfikatory całkowite Ćwiczysz Deep Learning Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Deep Learning Academy?

Nie wymagamy żadnego doświadczenia. Deep Learning Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Tokenizacja i budowanie słownika”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Deep Learning Academy?

Tak. Każda lekcja Deep Learning Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Tokenizacja i budowanie słownika
  2. nn.Embedding: uczone wektory słów
  3. Dlaczego embeddingi przechwytują znaczenie
  4. Wytrenować klasyfikator tekstu
← Powrót do Deep Learning Academy