NLP Academy · Lekcja

Wczytywanie modelu i przetwarzanie dokumentu

Przepuść tekst przez nlp() jednym wywołaniem

Lekcja 2 z 413 kroki

Wczytywanie modelu i przetwarzanie dokumentu to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.

Najpierw instalacja

Zanim cokolwiek Państwo załadują, należy jednorazowo pobrać model. Model en_core_web_sm jest mały, szybki i idealny na początek.

python -m spacy download en_core_web_sm

Ładowanie modelu

spaCy uruchamia się za pomocą spacy.load. Funkcja odczytuje model z dysku i zwraca obiekt nlp gotowy do przetwarzania tekstu.

import spacy
nlp = spacy.load("en_core_web_sm")

Czym jest nlp

Obiekt nlp to cały potok zamknięty w jednym obiekcie. Wywołanie go dla tekstu uruchamia każdy etap: tokenizator, tagger, parser i rozpoznawanie encji.

Przetwarzanie tekstu

Aby przeanalizować zdanie, wystarczy wywołać nlp() dla ciągu znaków. Wynikiem jest obiekt Doc — rozbudowany kontener przechowujący całą analizę.

doc = nlp("Apple is hiring in Berlin.")

Jedno wywołanie robi wszystko

To pojedyncze wywołanie wykonało już tokenizację, tagowanie i analizę składniową. Obiekt Doc zawiera teraz wszystkie wyniki, więc nie trzeba powtarzać tej pracy.

Iterowanie po tokenach

Obiekt Doc zachowuje się jak sekwencja, więc można po nim iterować. Każdy zwrócony element to obiekt Token z własnymi atrybutami.

for token in doc:
    print(token.text)

Odczyt tekstu tokenu

Surowe słowo znajduje się w token.text. Jest to dokładnie ten ciąg znaków, który spaCy znalazło podczas dzielenia zdania.

Załaduj raz i używaj ponownie

Ładowanie modelu jest powolne, dlatego należy wykonać je raz podczas uruchamiania programu. Następnie ten sam obiekt nlp można wykorzystywać do każdego przetwarzanego dokumentu.

Przetwarzanie wielu dokumentów

W przypadku dużej liczby tekstów proszę użyć nlp.pipe. Funkcja efektywnie przetwarza je partiami i jest znacznie szybsza niż wywoływanie nlp() w zwykłej pętli.

for doc in nlp.pipe(texts):
    print(len(doc))

Wyłączanie dla większej szybkości

Potrzebują Państwo tylko tokenów? Podczas ładowania można wyłączyć nieużywane komponenty, aby pominąć zbędną pracę i jeszcze przyspieszyć przetwarzanie.

nlp = spacy.load("en_core_web_sm", disable=["parser"])

Puste potoki

Można też rozpocząć od spacy.blank, aby utworzyć potok zawierający wyłącznie tokenizator. To przydatne, gdy chcą Państwo zbudować wszystko samodzielnie.

nlp = spacy.blank("en")

Szybkie sprawdzenie

Co otrzymuje się po wywołaniu nlp() dla ciągu znaków?

Podsumowanie

Instalują Państwo model, ładują go raz za pomocą spacy.load, a następnie wywołują nlp(), aby otrzymać obiekt Doc. Jedno wywołanie uruchamia cały potok, który można potem wykorzystywać wszędzie. 🎯

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Wczytywanie modelu i przetwarzanie dokumentu” jest bezpłatna?

Tak — pełny tekst „Wczytywanie modelu i przetwarzanie dokumentu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Wczytywanie modelu i przetwarzanie dokumentu”?

Przepuść tekst przez nlp() jednym wywołaniem Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć NLP Academy?

Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Wczytywanie modelu i przetwarzanie dokumentu”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?

Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego spaCy sprawdza się w prawdziwych projektach
  2. Wczytywanie modelu i przetwarzanie dokumentu
  3. Tokeny, spany i obiekty Doc
  4. Dostosowywanie potoku
← Powrót do NLP Academy