0Pricing
AI Engineering Academy · 강의

순진한 청킹이 검색에 해로운 이유

부적절한 청킹으로 발생하는 실제 검색 실패를 분석합니다. 청크 경계에서 답변이 나뉘거나 머리글과 섹션 제목에서 문맥이 손실되는 사례를 살펴봅니다.

순진한 청킹이 검색에 해로운 이유은(는) CoddyKit의 무료 AI Engineering Academy 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Engineering Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Engineering Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

부적절한 분할의 비용

분할은 문서를 벡터 저장소에 임베딩하기 전에 더 작은 조각으로 나누는 과정입니다. 문서를 어떻게 분할하느냐에 따라 검색 중에 사용할 수 있는 문맥이 결정됩니다. 부적절한 분할은 RAG 시스템이 실패하는 가장 흔하고 영향이 큰 원인 중 하나입니다.

경계에서 나뉘는 답변

다음과 같은 내용이 있는 문서를 생각해 보세요. '환불 정책은 구매일로부터 30일입니다. 고객은 원본 영수증을 첨부해야 합니다.' 고정 크기 분할기가 'purchase.' 뒤에서 자르면 두 문장이 서로 다른 조각에 들어갑니다. 환불 정책에 관한 질의는 앞부분만 검색할 수 있으므로 모델은 영수증 제출 요건을 언급하지 못하게 됩니다.

머리글에서 사라지는 문맥

문서는 의미를 전달하기 위해 섹션 머리글을 사용하는 경우가 많습니다. '기업용 요금제 가격'이라는 제목 뒤에 숫자로 된 행이 이어지는 표를 생각해 보세요. 머리글과 표가 서로 다른 조각에 들어가면 검색된 표 조각에는 레이블 없이 숫자만 남으므로, 모델은 '기업용 가격은 얼마인가요?'라는 질문에 올바르게 답할 수 없습니다.

고정 크기 분할의 문제점

고정 크기 분할은 문장 경계와 관계없이 N개의 문자 또는 토큰마다 텍스트를 나눕니다. 빠르고 간단하지만 문장 중간에서 자주 끊깁니다. 'The model was trained on'으로 끝나는 조각과 'a dataset of 500 billion tokens'으로 시작하는 다음 조각은 서로 없으면 각각 의미가 없습니다.

from langchain.text_splitter import CharacterTextSplitter

# Naive fixed-size: may break mid-sentence
splitter = CharacterTextSplitter(chunk_size=200, chunk_overlap=0)
chunks = splitter.split_text(document_text)
print(f'Created {len(chunks)} chunks')
print('First chunk:', chunks[0])

겹침이 항상 도움이 되지는 않습니다

일반적인 해결 방법은 조각 겹침을 추가하는 것입니다. 즉, 한 조각의 마지막 N개 토큰을 다음 조각의 시작 부분에 반복하는 방식입니다. 이는 나뉜 문장에 도움이 되지만 중복을 만들고, 매우 유사한 두 조각이 모두 검색될 때 검색기를 혼란스럽게 할 수 있습니다. 겹침은 구조적인 분할 문제를 치료하는 방법이 아니라 임시방편입니다.

# Overlap helps partially but adds redundancy
splitter = CharacterTextSplitter(
    chunk_size=500,
    chunk_overlap=50  # last 50 chars repeated in next chunk
)
chunks = splitter.split_text(document_text)

검색 실패율 측정하기

작은 골든 평가 세트를 만들어 분할이 검색에 악영향을 미치는 빈도를 측정할 수 있습니다. 골든 평가 세트는 정답인 원본 구절이 알려진 질문 목록입니다. 그런 다음 올바른 구절이 상위 k개의 검색된 조각 안에 포함되는 빈도를 확인하세요. 낮은 hit rate는 생성 품질을 살펴보기도 전에 분할 문제를 드러내는 경우가 많습니다.

def hit_rate(queries_and_answers, retriever, k=5):
    hits = 0
    for query, expected_text in queries_and_answers:
        results = retriever.retrieve(query, k=k)
        retrieved_texts = [r.page_content for r in results]
        if any(expected_text in text for text in retrieved_texts):
            hits += 1
    return hits / len(queries_and_answers)

코드 및 구조화된 데이터의 문제

코드 파일, JSON, 표에는 함수, 객체, 표의 행과 같은 논리적 단위가 있으므로 이를 나누어서는 안 됩니다. Python 함수 정의를 두 조각으로 나누면 어느 조각도 독립적으로 이해할 수 없습니다. 두 번째 조각을 찾은 검색기는 인수가 없는 코드만 보고 문맥을 알 수 없습니다.

# Bad: splits code arbitrarily
bad_chunk_1 = 'def calculate_price(item, qty'  # incomplete!
bad_chunk_2 = ', discount):\n    return item.price * qty * (1 - discount)'

# Good: keep the full function together
good_chunk = 'def calculate_price(item, qty, discount):\n    return item.price * qty * (1 - discount)'

긴 문서와 중간 내용의 손실

LLM에 관한 연구에서는 '중간에서 잊히는' 현상이 나타납니다. 많은 조각을 검색해 프롬프트에 한꺼번에 넣으면 모델은 시작과 끝에 가까운 내용에는 주의를 기울이지만 중간 내용은 무시하는 경향이 있습니다. 품질이 낮은 작은 조각을 많이 만들어 내는 부적절한 분할은 관련 신호를 희석해 이 현상을 악화시킵니다.

조각을 수동으로 진단하기

간단한 진단 방법은 조각에서 무작위 표본을 출력해 읽어 보는 것입니다. 다음과 같이 자문해 보세요. 이 조각은 단독으로 의미가 있는가? 사용자가 질문을 한다면 모델이 이 조각만으로 답할 수 있는가? 정의되지 않은 대명사('그가 이렇게 말했다...'), 불완전한 코드, 문맥이 없는 숫자를 포함한 조각은 문제의 신호입니다.

import random

def audit_chunks(chunks, sample_size=10):
    sample = random.sample(chunks, min(sample_size, len(chunks)))
    for i, chunk in enumerate(sample):
        print(f'--- Chunk {i+1} ({len(chunk)} chars) ---')
        print(chunk[:300])
        print()

조각 크기가 너무 클 때

매우 큰 조각은 검색 정밀도를 떨어뜨립니다. 광범위한 주제를 다루는 2,000토큰짜리 조각은 많은 질의와 일치할 수 있지만 LLM에 너무 많은 잡음을 전달합니다. 모델은 그 조각 안에서 건초 더미 속 바늘을 찾아야 합니다. 더 작고 집중된 조각은 주변 문맥을 놓칠 가능성이 있다는 대가로 정밀도를 높여 줍니다.

이 문제를 해결하는 전략

단순한 고정 크기 분할보다 나은 대안에는 다음이 있습니다. 문장 중간에서 절대 자르지 않는 문장 경계 분할, 주제 경계에서 나누는 의미 기반 분할, 더 넓은 문맥을 보존하는 상위-하위 분할, 코드 함수, HTML 태그, Markdown 머리글을 고려하는 문서 인식 분할입니다. 앞으로의 각 학습에서 이 방법 중 하나씩 다룹니다.

빠른 확인

이 학습에서 다룬 분할 실패 유형에 대한 이해도를 확인해 보세요.

학습 내용 요약

이 학습에서는 다음을 배웠습니다. 단순한 고정 크기 분할은 문장과 섹션의 경계를 끊습니다. 겹침은 부분적인 해결책이지만 중복을 추가합니다. 또한 조각의 품질은 검색 hit rate를 직접적으로 결정합니다. 다음으로는 임베딩 유사도를 사용해 자연스러운 주제 경계에서 텍스트를 나누는 의미 기반 분할을 살펴보겠습니다.

자주 묻는 질문

“순진한 청킹이 검색에 해로운 이유” 강의는 무료인가요?

네 — “순진한 청킹이 검색에 해로운 이유” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Engineering Academy 강의 전체를 잠금 해제할 수 있습니다. AI Engineering Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“순진한 청킹이 검색에 해로운 이유”에서 뭘 배우나요?

부적절한 청킹으로 발생하는 실제 검색 실패를 분석합니다. 청크 경계에서 답변이 나뉘거나 머리글과 섹션 제목에서 문맥이 손실되는 사례를 살펴봅니다. 브라우저에서 직접 실행하는 실습 코드로 AI Engineering Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Engineering Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Engineering Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“순진한 청킹이 검색에 해로운 이유” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Engineering Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Engineering Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 순진한 청킹이 검색에 해로운 이유
  2. 임베딩 유사도를 활용한 의미 기반 청킹
  3. 상위-하위 및 작은 단위에서 큰 단위로 검색
  4. 코드와 HTML을 위한 문서별 전략
← AI Engineering Academy(으)로 돌아가기