NLP Academy · Lekcja

Triki tokenizacji za pomocą regexów

Dziel tekst dokładnie tak, jak chcesz

Lekcja 4 z 413 kroki

Triki tokenizacji za pomocą regexów to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.

Tokenizacja za pomocą wzorców

Można tokenizować tekst, opisując wygląd tokenu, a następnie pozwalając wyrażeniu regularnemu znaleźć każdy fragment pasujący do tej definicji.

Bezpośrednie dopasowywanie słów

Wzorzec \w+ użyty z findall wyszukuje każdy ciąg znaków słownych, tworząc przejrzystą listę słów i pomijając spacje między nimi.

re.findall("\w+", "Hello, world!")

Dzielenie zamiast dopasowywania

Funkcja re.split dzieli tekst wszędzie tam, gdzie występuje wzorzec. Dzielenie po białych znakach szybko zamienia zdanie w listę przybliżonych tokenów.

re.split("\s+", "one  two three")

Dzielenie po wielu separatorach

Za pomocą klasy znaków funkcja re.split może jednocześnie dzielić po wielu separatorach, takich jak spacje, przecinki i średniki.

re.split("[ ,;]+", "a, b;c d")

Zachowywanie interpunkcji jako tokenów

Czasami interpunkcja ma znaczenie. Wzorzec taki jak \w+|[^\w\s] przechwytuje osobno słowa i pojedyncze symbole, dzięki czemu nic nie zostaje pominięte.

Operator alternatywy

Potok oznacza „lub”. Wzorzec cat|dog dopasowuje jedno z tych słów, dzięki czemu jeden wyrażenie regularne może opisywać kilka potrzebnych kształtów tokenów.

re.findall("cat|dog", "a dog, a cat")

Dopasowywanie liczb i ułamków dziesiętnych

Liczby wymagają osobnej reguły. Wzorzec \d+\.?\d* dopasowuje liczby całkowite i dziesiętne, dzięki czemu ceny i kwoty pozostają jednym tokenem.

re.findall("\d+\.?\d*", "buy 3 for 4.50")

Obsługa skrótów

Naive splitting niszczy słowa zapisane w skróconej formie, takie jak do not. Inteligentniejszy wzorzec tokenów może zachować apostrofy wewnątrz słowa, tam gdzie powinny się znajdować.

Granice słów pomagają

Znacznik \b oznacza granicę słowa, czyli krawędź między słowem a znakiem niesłownym. Pomaga pobierać całe słowa bez dołączania sąsiednich znaków.

Budowanie wzorca tokenów

Praktyczny tokenizer często łączy reguły za pomocą alternatywy: w ustalonej kolejności dopasowuje najpierw adresy URL, następnie liczby, słowa i symbole.

Kompilowanie dla większej szybkości

Jeśli wielokrotnie używa Pan/Pani tego samego wzorca, re.compile zamienia go w obiekt wielokrotnego użytku. Kod jest czytelniejszy, a działanie szybsze dla wielu ciągów znaków.

tok = re.compile("\w+")

Szybkie sprawdzenie

Chce Pan/Pani podzielić ciąg znaków wszędzie tam, gdzie występuje co najmniej jedna spacja. Która funkcja będzie najlepsza?

Podsumowanie: tokenizery oparte na wyrażeniach regularnych

Użył(a) Pan/Pani funkcji findall, split, alternation i compile, aby zamienić surowy tekst dokładnie na wybrane tokeny. Wyrażenia regularne dają pełną kontrolę. 🎯

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Triki tokenizacji za pomocą regexów” jest bezpłatna?

Tak — pełny tekst „Triki tokenizacji za pomocą regexów” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Triki tokenizacji za pomocą regexów”?

Dziel tekst dokładnie tak, jak chcesz Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć NLP Academy?

Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Triki tokenizacji za pomocą regexów”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?

Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Regex w 5 minut
  2. Wyszukiwanie adresów e-mail i URL-i
  3. Grupy przechwytujące i zamiany
  4. Triki tokenizacji za pomocą regexów
← Powrót do NLP Academy