0Pricing
AI Agents · 강의

문서 집합 인덱싱

모든 청크를 임베딩하고 벡터를 인덱스에 저장해보세요. 모든 RAG 시스템의 오프라인 준비 단계입니다.

문서 집합 인덱싱은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

수집 파이프라인

오프라인 RAG 파이프라인에는 네 단계가 있습니다:

  1. 문서(PDF, HTML, MD)를 불러옵니다
  2. 각 문서를 청크로 나눕니다
  3. 각 청크를 임베딩합니다
  4. 벡터와 메타데이터를 색인에 저장합니다

1단계: 문서 불러오기

형식에 따라 특화된 로더를 사용합니다:

# PDFs
from pypdf import PdfReader
text = ''
for page in PdfReader('doc.pdf').pages:
    text += page.extract_text()

# HTML
from bs4 import BeautifulSoup
text = BeautifulSoup(html, 'html.parser').get_text()

# Markdown — just read the file
text = open('doc.md').read()

2단계: 청크로 나누기

이전 수업에서 사용한 분할기를 사용합니다:

from langchain.text_splitter import RecursiveCharacterTextSplitter
splitter = RecursiveCharacterTextSplitter(chunk_size=800, chunk_overlap=100)
chunks = splitter.split_text(text)

3단계: 배치 단위로 임베딩하기

API 호출 한 번에 여러 청크를 임베딩합니다:

from openai import OpenAI
client = OpenAI()

def embed_batch(texts, batch_size=100):
    vectors = []
    for i in range(0, len(texts), batch_size):
        batch = texts[i:i + batch_size]
        resp = client.embeddings.create(model='text-embedding-3-small', input=batch)
        vectors.extend(d.embedding for d in resp.data)
    return vectors

4단계: 저장하기

청크가 1만~5만 개라면 FAISS 또는 Chroma로 충분합니다:

import chromadb
client = chromadb.Client()
collection = client.create_collection('docs')

collection.add(
    ids=[f'doc-{i}' for i in range(len(chunks))],
    embeddings=vectors,
    documents=chunks,
    metadatas=[{'source': 'doc.pdf', 'page': i} for i in range(len(chunks))]
)

멱등적인 수집

수집을 다시 실행해도 안전하도록 만듭니다. 콘텐츠 해시를 사용한 결정론적 식별자를 사용하면 다시 실행해도 중복되지 않습니다:

import hashlib

def chunk_id(source, text):
    h = hashlib.sha256(text.encode()).hexdigest()[:16]
    return f'{source}:{h}'

print(chunk_id('handbook.pdf', 'Employees get 20 vacation days per year.'))
print(chunk_id('handbook.pdf', 'Employees get 20 vacation days per year.'))

증분 업데이트

문서가 변경되었을 때:

  1. 새 청크를 계산합니다
  2. 기존 식별자와 비교합니다
  3. 삭제된 항목은 삭제하고, 새 항목은 추가하며, 변경되지 않은 항목은 유지합니다

단순한 방법(모두 삭제한 후 다시 삽입)은 작은 말뭉치에는 괜찮지만 임베딩 API 호출을 낭비합니다.

필터링을 위한 메타데이터

나중에 필터링할 가능성이 있는 모든 필드를 포함합니다:

metadata = {
    'source': '/docs/handbook.pdf',
    'page': 42,
    'department': 'engineering',
    'updated_at': '2024-08-12',
    'access_level': 'internal'
}
for k, v in metadata.items():
    print(f"{k}: {v}")

진행 상황 및 체크포인트

대규모 수집에서는 진행 상황을 기록하고 체크포인트를 저장합니다:

for i, batch in enumerate(batches):
    embed_and_store(batch)
    if i % 10 == 0:
        save_checkpoint(i)
        print(f'Processed {i * 100} chunks')

요청 제한

OpenAI 임베딩에는 높은 수준이지만 실제로 적용되는 요청 제한이 있습니다. 세마포어 또는 `tenacity` 재시도를 사용합니다:

from asyncio import Semaphore
sem = Semaphore(10)  # 10 concurrent embed calls max

async def safe_embed(batch):
    async with sem:
        return await client.embeddings.create(...)

색인 정상 여부 확인

수집이 끝나면 몇 가지 시험 질의를 실행하고 결과를 직접 확인합니다. 관련 결과가 전혀 나오지 않는다면 청킹 또는 임베딩에 문제가 있는 것이므로 사용자가 발견하기 전에 원인을 찾아야 합니다.

색인 버전 관리

색인을 버전 관리하면 중단 시간 없이 새로운 청킹 방식이나 임베딩 모델로 교체할 수 있습니다:

collection = client.create_collection(f'docs-v2-{date.today()}')
# old collection stays live until new one is validated

멱등적인 식별자

콘텐츠 해시를 청크 식별자로 사용하는 이유는 무엇인가요?

요약

멱등적인 식별자와 메타데이터를 사용하여 불러오기 -> 청킹 -> 임베딩 -> 저장의 순서로 처리합니다. 색인은 이후의 모든 검색 단계의 기반입니다.

자주 묻는 질문

“문서 집합 인덱싱” 강의는 무료인가요?

네 — “문서 집합 인덱싱” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“문서 집합 인덱싱”에서 뭘 배우나요?

모든 청크를 임베딩하고 벡터를 인덱스에 저장해보세요. 모든 RAG 시스템의 오프라인 준비 단계입니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“문서 집합 인덱싱” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. RAG가 해결하는 문제(지식 기준일, 환각)
  2. 청크 분할 전략(고정, 문장, 의미)
  3. 문서 집합 인덱싱
  4. FAISS 또는 Chroma로 단순한 RAG 구축
← AI Agents(으)로 돌아가기