Wczytywanie modelu i przetwarzanie dokumentu
Przepuść tekst przez nlp() jednym wywołaniem
Wczytywanie modelu i przetwarzanie dokumentu to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.
Najpierw instalacja
Zanim cokolwiek Państwo załadują, należy jednorazowo pobrać model. Model en_core_web_sm jest mały, szybki i idealny na początek.
python -m spacy download en_core_web_smŁadowanie modelu
spaCy uruchamia się za pomocą spacy.load. Funkcja odczytuje model z dysku i zwraca obiekt nlp gotowy do przetwarzania tekstu.
import spacy
nlp = spacy.load("en_core_web_sm")Czym jest nlp
Obiekt nlp to cały potok zamknięty w jednym obiekcie. Wywołanie go dla tekstu uruchamia każdy etap: tokenizator, tagger, parser i rozpoznawanie encji.
Przetwarzanie tekstu
Aby przeanalizować zdanie, wystarczy wywołać nlp() dla ciągu znaków. Wynikiem jest obiekt Doc — rozbudowany kontener przechowujący całą analizę.
doc = nlp("Apple is hiring in Berlin.")Jedno wywołanie robi wszystko
To pojedyncze wywołanie wykonało już tokenizację, tagowanie i analizę składniową. Obiekt Doc zawiera teraz wszystkie wyniki, więc nie trzeba powtarzać tej pracy.
Iterowanie po tokenach
Obiekt Doc zachowuje się jak sekwencja, więc można po nim iterować. Każdy zwrócony element to obiekt Token z własnymi atrybutami.
for token in doc:
print(token.text)Odczyt tekstu tokenu
Surowe słowo znajduje się w token.text. Jest to dokładnie ten ciąg znaków, który spaCy znalazło podczas dzielenia zdania.
Załaduj raz i używaj ponownie
Ładowanie modelu jest powolne, dlatego należy wykonać je raz podczas uruchamiania programu. Następnie ten sam obiekt nlp można wykorzystywać do każdego przetwarzanego dokumentu.
Przetwarzanie wielu dokumentów
W przypadku dużej liczby tekstów proszę użyć nlp.pipe. Funkcja efektywnie przetwarza je partiami i jest znacznie szybsza niż wywoływanie nlp() w zwykłej pętli.
for doc in nlp.pipe(texts):
print(len(doc))Wyłączanie dla większej szybkości
Potrzebują Państwo tylko tokenów? Podczas ładowania można wyłączyć nieużywane komponenty, aby pominąć zbędną pracę i jeszcze przyspieszyć przetwarzanie.
nlp = spacy.load("en_core_web_sm", disable=["parser"])Puste potoki
Można też rozpocząć od spacy.blank, aby utworzyć potok zawierający wyłącznie tokenizator. To przydatne, gdy chcą Państwo zbudować wszystko samodzielnie.
nlp = spacy.blank("en")Szybkie sprawdzenie
Co otrzymuje się po wywołaniu nlp() dla ciągu znaków?
Podsumowanie
Instalują Państwo model, ładują go raz za pomocą spacy.load, a następnie wywołują nlp(), aby otrzymać obiekt Doc. Jedno wywołanie uruchamia cały potok, który można potem wykorzystywać wszędzie. 🎯
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Wczytywanie modelu i przetwarzanie dokumentu” jest bezpłatna?
Tak — pełny tekst „Wczytywanie modelu i przetwarzanie dokumentu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Wczytywanie modelu i przetwarzanie dokumentu”?
Przepuść tekst przez nlp() jednym wywołaniem Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć NLP Academy?
Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Wczytywanie modelu i przetwarzanie dokumentu”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?
Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego spaCy sprawdza się w prawdziwych projektach
- Wczytywanie modelu i przetwarzanie dokumentu
- Tokeny, spany i obiekty Doc
- Dostosowywanie potoku