0Pricing
NLP Academy · Lekcja

Tokeny, spany i obiekty Doc

Poruszaj się po strukturach danych spaCy

Tokeny, spany i obiekty Doc to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.

Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.

Three Core Objects

spaCy gives you three building blocks: the Doc, the Token, and the Span. Learn these and the whole library opens up.

The Doc Container

A Doc is the full processed document. It holds the original text plus every token and all the analysis spaCy produced.

doc = nlp("Maria leads the data team.")

Index Like a List

You can grab one item by position because a Doc is indexable. Indexing returns a single Token, just like a Python list.

first = doc[0]

What a Token Holds

A Token is one unit of text plus rich metadata: its part of speech, its lemma, and whether it is punctuation.

print(doc[0].text, doc[0].pos_)

Useful Token Flags

Tokens carry handy flags like is_stop, is_alpha, and is_punct. They let you filter words without writing your own checks.

for t in doc:
    print(t.text, t.is_stop)

Slice to Get a Span

Slice a Doc and you get a Span, a contiguous run of tokens. It is perfect for phrases like a person or a place.

phrase = doc[0:2]

Spans Keep Context

A Span is not a copy. It still points back into the Doc, so it knows its position and shares all the original analysis.

Entities Are Spans

Named entities show up as Spans in doc.ents. Each one bundles the words plus a label like PERSON or ORG.

for ent in doc.ents:
    print(ent.text, ent.label_)

Noun Chunks

spaCy also offers noun_chunks, base noun phrases served as Spans. They are a quick way to pull out the things a sentence talks about.

list(doc.noun_chunks)

Sentences as Spans

Need sentences? Iterate doc.sents. Each sentence comes back as a Span, so segmentation is already handled for you.

for sent in doc.sents:
    print(sent.text)

Original Text Stays

Through all of this the original string is preserved in doc.text. Tokens and spans are views, never destructive edits.

Quick Check

What do you get when you slice a Doc with doc[0:3]?

Recap

The Doc holds everything, indexing gives one Token, and slicing gives a Span. Entities, noun chunks, and sentences all arrive as Spans. 🧩

Często zadawane pytania

Czy lekcja „Tokeny, spany i obiekty Doc” jest bezpłatna?

Tak — pełny tekst „Tokeny, spany i obiekty Doc” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Tokeny, spany i obiekty Doc”?

Poruszaj się po strukturach danych spaCy Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć NLP Academy?

Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Tokeny, spany i obiekty Doc”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?

Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego spaCy sprawdza się w prawdziwych projektach
  2. Wczytywanie modelu i przetwarzanie dokumentu
  3. Tokeny, spany i obiekty Doc
  4. Dostosowywanie potoku
← Powrót do NLP Academy