토큰화와 정규화
텍스트 전처리 기법을 학습합니다.
토큰화와 정규화은(는) CoddyKit의 무료 Learn AI with Python 강의입니다. 이것은 5개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Learn AI with Python 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Learn AI with Python 강의에는 총 5개의 강의가 포함되어 있습니다.
텍스트 전처리 기초
토큰화와 정규화
텍스트 전처리는 자연어 처리에서 중요한 단계입니다. 분석을 위해 원시 텍스트를 구조화된 형식으로 변환하는 과정입니다. 주요 전처리 단계로는 토큰화와 정규화가 있습니다.

토큰화란 무엇인가요?
토큰화란 무엇인가요?
토큰화는 텍스트를 토큰이라고 하는 더 작은 단위로 나누는 과정입니다. 토큰은 단어, 문장 또는 문자일 수 있습니다.
예를 들면 다음과 같습니다.
텍스트: "NLP is amazing!"
토큰: ["NLP", "is", "amazing", "!"]
파이썬 토큰화 예시
파이썬 토큰화 예시
NLTK 라이브러리를 사용하면 텍스트를 단어나 문장으로 토큰화할 수 있습니다.
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)정규화란 무엇인가요?
정규화란 무엇인가요?
정규화는 텍스트를 정리하고 표준화하는 과정입니다. 일반적인 정규화 기법은 다음과 같습니다.
- 소문자화: 모든 텍스트를 소문자로 변환합니다.
- 문장 부호 제거: 문장 부호를 없앱니다.
- 어간 추출: 단어를 어간 형태로 줄입니다(예: "달리고 있다" → "달리다").
- 표제어 추출: 문맥을 사용하여 단어를 의미 있는 기본형으로 줄입니다(예: "더 좋은" → "좋다").
소문자화 및 문장 부호 제거
소문자화 및 문장 부호 제거
다음과 같이 텍스트를 소문자로 바꾸고 문장 부호를 제거하여 정규화할 수 있습니다.
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)어간 추출과 표제어 추출
어간 추출과 표제어 추출
어간 추출: 접미사를 잘라 단어를 어간으로 줄입니다. 규칙 기반으로 작동하므로 항상 유효한 단어가 만들어지는 것은 아닙니다.
표제어 추출: 어휘와 문법 규칙을 사용하여 단어를 의미 있는 기본형으로 줄입니다.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))불용어 제거
불용어 제거
불용어는 "이다", "그리고", "그"와 같이 흔히 사용되지만 중요한 의미를 충분히 전달하지 않는 단어입니다. 불용어를 제거하면 텍스트 분석을 단순화할 수 있습니다.
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)텍스트 전처리의 과제
텍스트 전처리의 과제
텍스트 전처리는 다음과 같은 이유로 어려울 수 있습니다.
- 모호성: "배"처럼 여러 의미를 가질 수 있는 단어가 있습니다.
- 문맥: 표제어 추출을 위해서는 단어가 사용된 문맥을 이해해야 합니다.
- 언어별 차이: 서로 다른 언어와 방언을 처리해야 합니다.
요약 및 다음 단계
요약 및 다음 단계
이 단원에서는 다음을 학습했습니다.
- 토큰화와 정규화에 대해 학습했습니다.
- 어간 추출, 표제어 추출, 불용어 제거와 같은 기법을 살펴보았습니다.
- 파이썬으로 텍스트 전처리를 연습했습니다.
다음에는 N-그램 모델을 사용하여 텍스트 패턴을 분석하겠습니다.

자주 묻는 질문
“토큰화와 정규화” 강의는 무료인가요?
네 — “토큰화와 정규화” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Learn AI with Python 강의 전체를 잠금 해제할 수 있습니다. Learn AI with Python 강의에는 총 5개의 강의가 포함되어 있습니다.
“토큰화와 정규화”에서 뭘 배우나요?
텍스트 전처리 기법을 학습합니다. 브라우저에서 직접 실행하는 실습 코드로 Learn AI with Python을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Learn AI with Python을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Learn AI with Python은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 5개 중 2번째 강의입니다.
“토큰화와 정규화” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Learn AI with Python 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Learn AI with Python 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.