Токены, spans и объекты Doc
Изучите структуры данных spaCy
«Токены, spans и объекты Doc» — бесплатный урок NLP Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Three Core Objects
spaCy gives you three building blocks: the Doc, the Token, and the Span. Learn these and the whole library opens up.
The Doc Container
A Doc is the full processed document. It holds the original text plus every token and all the analysis spaCy produced.
doc = nlp("Maria leads the data team.")Index Like a List
You can grab one item by position because a Doc is indexable. Indexing returns a single Token, just like a Python list.
first = doc[0]What a Token Holds
A Token is one unit of text plus rich metadata: its part of speech, its lemma, and whether it is punctuation.
print(doc[0].text, doc[0].pos_)Useful Token Flags
Tokens carry handy flags like is_stop, is_alpha, and is_punct. They let you filter words without writing your own checks.
for t in doc:
print(t.text, t.is_stop)Slice to Get a Span
Slice a Doc and you get a Span, a contiguous run of tokens. It is perfect for phrases like a person or a place.
phrase = doc[0:2]Spans Keep Context
A Span is not a copy. It still points back into the Doc, so it knows its position and shares all the original analysis.
Entities Are Spans
Named entities show up as Spans in doc.ents. Each one bundles the words plus a label like PERSON or ORG.
for ent in doc.ents:
print(ent.text, ent.label_)Noun Chunks
spaCy also offers noun_chunks, base noun phrases served as Spans. They are a quick way to pull out the things a sentence talks about.
list(doc.noun_chunks)Sentences as Spans
Need sentences? Iterate doc.sents. Each sentence comes back as a Span, so segmentation is already handled for you.
for sent in doc.sents:
print(sent.text)Original Text Stays
Through all of this the original string is preserved in doc.text. Tokens and spans are views, never destructive edits.
Quick Check
What do you get when you slice a Doc with doc[0:3]?
Recap
The Doc holds everything, indexing gives one Token, and slicing gives a Span. Entities, noun chunks, and sentences all arrive as Spans. 🧩
Часто задаваемые вопросы
Урок «Токены, spans и объекты Doc» бесплатный?
Да — полный текст урока «Токены, spans и объекты Doc» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Токены, spans и объекты Doc»?
Изучите структуры данных spaCy Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Токены, spans и объекты Doc»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему для реальных проектов стоит выбрать spaCy
- Загрузка модели и обработка документа
- Токены, spans и объекты Doc
- Настройка конвейера