계층적 요약
장 → 섹션 → 문서 요약으로 점진적으로 압축합니다.
계층적 요약은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
계층적 요약이란 무엇인가요?
계층적 요약은 문서 자체의 구조를 반영합니다. 모든 청크를 동일하게 취급하는 대신, 콘텐츠를 수준별로 압축합니다:
- 페이지 → 섹션 요약
- 섹션 → 장 요약
- 장 → 문서 요약
각 수준은 바로 아래 수준을 압축한 표현입니다. 사람이 책을 요약할 때 장을 읽고 머릿속으로 요약한 다음 통합하는 방식과 같습니다.
계층적 요약을 사용하는 경우
계층적 요약은 다음과 같은 경우에 적합합니다:
- 책: 200쪽 이상이며 장 구조가 분명한 책
- 연구 논문: 초록, 서론, 방법, 결과, 논의
- 법률 계약서: 제목이 명확하게 정의된 섹션(정의, 의무, 종료)
- 기술 보고서: 경영진 요약 → 결과 → 부록
짧은 기사에는 지나치게 복잡한 방법입니다. 문서가 자연스러운 트리 구조를 가질 때 특히 효과적입니다.
문서 트리 구조
문서를 트리로 모델링합니다:
- 루트: 최종 요약
- 1단계 노드: 장 요약
- 2단계 노드: 섹션 요약
- 리프: 원시 페이지 또는 청크 텍스트
요약은 아래에서 위로 진행됩니다. 리프 → 2단계 → 1단계 → 루트 순서입니다. 각 노드의 요약은 해당 자식 노드의 요약만으로 도출됩니다.
from dataclasses import dataclass, field
from typing import List, Optional
@dataclass
class DocNode:
title: str
content: str = ''
summary: str = ''
children: List['DocNode'] = field(default_factory=list)
# Example: book with 3 chapters, each with 3 sections
book = DocNode(
title='My Book',
children=[
DocNode('Chapter 1', children=[
DocNode('Section 1.1', content='...raw text...'),
DocNode('Section 1.2', content='...raw text...'),
]),
DocNode('Chapter 2', children=[
DocNode('Section 2.1', content='...raw text...'),
])
]
)상향식 요약
트리를 아래에서 위로 순회합니다. 리프 노드는 원시 콘텐츠를 바탕으로 요약하고, 내부 노드는 자식 노드의 요약을 바탕으로 요약합니다.
import openai
client = openai.OpenAI(api_key='sk-...')
def summarize_text(text, role='section'):
resp = client.chat.completions.create(
model='gpt-4o',
messages=[
{'role': 'system',
'content': f'Summarize this {role} in 3-5 sentences.'},
{'role': 'user', 'content': text}
]
)
return resp.choices[0].message.content
def summarize_tree(node, depth=0):
role = ['document', 'chapter', 'section', 'page'][min(depth, 3)]
if not node.children:
node.summary = summarize_text(node.content, role)
else:
for child in node.children:
summarize_tree(child, depth + 1)
combined = '\n\n'.join(
f'{c.title}:\n{c.summary}' for c in node.children
)
node.summary = summarize_text(combined, role)
return node.summary점진적 압축
점진적 압축은 각 수준에서 정보 밀도를 낮추는 것을 의미합니다. 일반적인 기준은 다음과 같습니다:
- 페이지(토큰 2000개) → 섹션 요약(토큰 200개) — 10배 압축
- 섹션 요약(토큰 200개) → 장 요약(토큰 100개) — 2배 압축
- 장 요약(토큰 100개 5개) → 문서(토큰 150개) — 3배 압축
총 10,000개 토큰의 문서를 주요 논지를 유지하면서 약 150개 토큰으로 압축할 수 있습니다. 각 수준에서 압축 비율을 유지하도록 프롬프트를 작성합니다.
PAGE_PROMPT = 'Summarize this page in 2-3 sentences (under 80 words).'
SECTION_PROMPT = 'Given these page summaries, write a section summary in 3-4 sentences (under 120 words).'
CHAPTER_PROMPT = 'Given these section summaries, write a chapter summary in 4-5 sentences (under 150 words).'
DOC_PROMPT = 'Given these chapter summaries, write an executive summary of the entire document (under 200 words).'수준 간 일관성 유지
계층적 요약의 한 가지 위험은 한 수준의 요약들이 서로 모순되거나 같은 내용을 반복할 수 있다는 점이며, 이러한 오류가 위 단계로 갈수록 누적된다는 것입니다. 일관성을 유지하는 방법은 다음과 같습니다:
- 모델이 문맥을 파악할 수 있도록 프롬프트에 상위 섹션 제목 포함
- 이전 섹션 요약에 이미 언급된 사실을 반복하지 않도록 모델에 요청
- 최종 리듀스 단계에서 모순을 명시적으로 해결하도록 모델에 요청
def summarize_sections_for_chapter(chapter_title, section_summaries):
content = '\n\n'.join(
f'Section: {s["title"]}\n{s["summary"]}'
for s in section_summaries
)
prompt = (
f'Chapter: {chapter_title}\n\n'
'Below are summaries of each section. '
'Write a unified chapter summary without repeating '
'the same facts from multiple sections.\n\n' + content
)
resp = client.chat.completions.create(
model='gpt-4o',
messages=[{'role': 'user', 'content': prompt}]
)
return resp.choices[0].message.content연구 논문의 계층 구조
연구 논문은 자연스러운 계층 구조를 가집니다: 초록 → 서론 → 방법 → 결과 → 논의 → 결론. 각 섹션에는 고유한 역할이 있으므로 섹션별 프롬프트를 사용합니다:
SECTION_PROMPTS = {
'abstract': 'Summarize the paper abstract: what problem, method, and result?',
'introduction': 'Summarize the introduction: what gap does the paper address?',
'methods': 'Summarize the methods: what approach was used?',
'results': 'Summarize the results: what were the key findings and metrics?',
'discussion': 'Summarize the discussion: what do the results mean?',
'conclusion': 'Summarize the conclusion and future work.'
}
def summarize_paper(sections_dict):
section_summaries = {}
for section, text in sections_dict.items():
prompt = SECTION_PROMPTS.get(section, 'Summarize this section.')
section_summaries[section] = call_llm(prompt, text)
return section_summaries법률 계약서의 계층 구조
법률 계약서는 조항 계층을 따릅니다: 정의 → 의무 → 구제 수단 → 종료 → 준거법. 계층적 요약에서는 다음을 보존해야 합니다:
- 정확한 수치(지급 금액, 기한)
- 당사자 이름(고객, 공급업체, 라이선스 제공자)
- 조건부 표현(…하지 않는 한, …인 경우를 제외하고, …라는 조건으로)
요약 중인 조항에 숫자 금액이나 조건부 표현이 있으면 이를 표시하도록 모델에 요청하여 실수로 누락되지 않게 합니다.
LEGAL_PROMPT = '''Summarize this contract clause in plain English.
Preserve: all monetary amounts, dates, party names, and conditionals.
Flag any obligation with [OBLIGATION] and any amount with [AMOUNT].'''
def summarize_clause(clause_text):
resp = client.chat.completions.create(
model='gpt-4o',
messages=[
{'role': 'system', 'content': LEGAL_PROMPT},
{'role': 'user', 'content': clause_text}
]
)
return resp.choices[0].message.content계층적 요약 저장
루트 요약만이 아니라 전체 요약 트리를 저장합니다. 이렇게 하면 다음과 같은 작업이 가능합니다:
- 세부로 내려가기 — 필요할 때 장 요약을 표시한 다음 섹션 요약 표시
- 검색 — 전체 문서뿐 아니라 섹션 요약을 대상으로 사용자 질의 검색
- 갱신 — 한 섹션이 변경되면 트리의 해당 가지에 대해서만 재요약
import json
def tree_to_dict(node):
return {
'title': node.title,
'summary': node.summary,
'children': [tree_to_dict(c) for c in node.children]
}
def save_tree(node, path):
with open(path, 'w') as f:
json.dump(tree_to_dict(node), f, indent=2)
print(f'Saved summary tree to {path}')증분 갱신
문서가 갱신되면 계층 구조를 활용해 증분 재요약을 수행할 수 있습니다. 수정된 노드와 그 조상 노드만 재요약하면 되며, 모든 형제 가지는 그대로 유효합니다.
10개 장으로 구성된 책에서 3장이 수정되었다고 가정해 보겠습니다. 3장의 섹션을 재요약한 다음 3장과 책 전체를 재요약합니다. 모든 노드가 아니라 3개 노드만 다시 계산하면 됩니다.
def update_node(node, updated_child_title):
# Re-summarize the changed child
for child in node.children:
if child.title == updated_child_title:
summarize_tree(child) # re-summarize from leaves
break
# Re-summarize current node from updated children
combined = '\n\n'.join(
f'{c.title}:\n{c.summary}' for c in node.children
)
node.summary = summarize_text(combined)
return node.summary평면 구조와 계층 구조 비교
평면 맵리듀스와 계층적 요약을 비교하면 다음과 같습니다:
- 평면: 더 단순하고 문서 구조를 무시하며, 균일한 문서(뉴스 기사)에 적합
- 계층적: 구조를 반영하고 세부 탐색이 가능하며, 구조화된 문서에서 더 일관성 있음
실제로는 두 방식을 결합하는 것이 좋습니다. 각 장 안에서는 평면 맵리듀스(많은 페이지)를 사용하고, 장 사이에는 계층적 요약을 적용합니다. 이는 실제 문서에 가장 견고한 접근 방식입니다.
지식 확인
계층적 요약에서 요약 과정은 문서 트리를 어느 방향으로 진행하나요?
복습: 계층적 요약
계층적 요약은 문서 구조를 반영하여 더 나은 결과를 제공합니다:
- 문서를 트리로 모델링: 페이지 → 섹션 → 장 → 문서
- 아래에서 위로 요약: 리프부터 시작해 마지막에 루트를 요약
- 각 수준에서 점진적 압축을 적용하여 일관성 유지
- 명확한 계층 구조를 가진 책, 연구 논문, 법률 계약서에 적합
- 전체 트리를 저장하여 세부 탐색 검색과 증분 갱신 지원
다음 수업에서는 오버랩과 누적 요약을 사용해 청크 간 문맥을 유지하는 방법을 다룹니다.
자주 묻는 질문
“계층적 요약” 강의는 무료인가요?
네 — “계층적 요약” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
“계층적 요약”에서 뭘 배우나요?
장 → 섹션 → 문서 요약으로 점진적으로 압축합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“계층적 요약” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.