백만 토큰 컨텍스트 창
기회와 주의할 점
백만 토큰 컨텍스트 창은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
토큰 100만 개로 얻는 것
토큰 100만 개를 지원하는 창을 사용하면 전체 코드베이스, 문서 말뭉치 또는 여러 시간 분량의 전사문을 검색 시스템 없이 컨텍스트에 직접 배치할 수 있습니다. 그 약속은 모든 것을 컨텍스트에 담기입니다. 모델이 정보 손실이 있는 요약이 아니라 원자료를 바탕으로 추론합니다.
- 전체 저장소를 대상으로 한 추론과 리팩터링
- 조각으로 나누지 않는 문서 간 종합
- 초기의 세부 내용까지 유지하는 장기 대화
하지만 용량이 곧 효과적인 사용을 의미하지는 않습니다.
용량과 실질적 컨텍스트
광고된 창 크기는 상한선일 뿐, 모든 위치에서 동일하게 내용을 기억해낸다는 보장은 아닙니다. 실질적 컨텍스트는 모델이 안정적으로 정보를 찾아내고 추론할 수 있는 범위이며, 일반적으로 더 작고 위치에 따라 고르지 않습니다.
창을 가치가 균일하지 않은 예산으로 다루세요. 가장자리 근처의 토큰은 중간 깊숙이 묻힌 토큰보다 더 잘 회수됩니다.
지연 시간과 비용의 현실
컨텍스트 길이가 길어질수록 어텐션 비용이 증가하고 첫 토큰까지 걸리는 시간도 늘어납니다. 토큰 100만 개로 이루어진 프롬프트는 답변이 짧더라도 사전 입력 처리에 수 초가 걸리고 호출마다 상당한 비용이 발생할 수 있습니다.
- 거대한 프롬프트에서는 입력 사전 처리가 지연 시간의 대부분을 차지합니다.
- 출력 크기와 관계없이 입력 토큰 수에 따라 비용이 증가합니다.
- 필요하지 않은 컨텍스트를 억지로 넣는 것은 모델을 혼란스럽게 만드는 데 비용을 지불하는 일입니다.
# Rough mental model: input tokens drive both $ and prefill ms.
# 900k tokens of haystack to answer one question is rarely optimal.산만함과 희석
컨텍스트가 많아지면 정확도가 떨어질 수 있습니다. 관련 없는 자료는 주의집중을 희석하고 모델이 붙잡을 수 있는 방해 요소를 추가합니다. 특정 질문에는 시끄러운 토큰 50만 개짜리 프롬프트보다 집중된 토큰 2만 개짜리 프롬프트가 더 나은 경우가 많습니다.
규칙은 이렇습니다. 작업에 도움이 되는 내용은 포함하고, 그저 관련이 있을 수도 있는 내용은 제외하세요.
긴 컨텍스트가 검색보다 나은 경우
검색으로는 여러 조각으로 나뉘는 전체적이고 여러 부분을 가로지르는 추론이 필요한 작업에서 긴 컨텍스트가 더 효과적입니다. 예를 들어 '저장소 전체에서 이 불변식이 위반된 모든 위치를 찾기'나 '열 개의 모든 계약서에서 모순을 조정하기'가 있습니다. 조각으로 나눈 검색은 조각 사이에 걸쳐 있는 연결을 놓칠 수 있습니다.
종합에는 전체 컨텍스트를 사용하고, 방대한 말뭉치에서 특정 항목을 찾을 때는 검색을 사용하세요.
검색이 긴 컨텍스트보다 나은 경우
관련된 부분의 비율이 매우 작고 안정적일 때는 검색이 더 효과적입니다. 5만 페이지 전체를 모델에 넣고 찾기를 기대하는 것보다 5만 페이지 중 관련 있는 5페이지만 가져오는 편이 저렴하고 빠르며 정확한 경우가 많습니다.
- 정적 말뭉치에 대한 반복적인 질의 -> 한 번 색인하고 저렴하게 검색
- 일회성 전체 종합 -> 긴 컨텍스트
많은 시스템은 두 방식을 결합합니다. 검색으로 범위를 좁힌 다음 긴 컨텍스트로 종합합니다.
def route(task):
if task.is_global_synthesis: return 'long_context'
if task.relevant_fraction < 0.05: return 'retrieval'
return 'hybrid'위치는 자원입니다
위치에 따라 회수 성능이 달라지므로 콘텐츠를 어디에 배치할지는 설계상의 결정입니다. 모델이 가장 잘 회수하는 경계 부분에 작업 지침과 가장 중요한 자료를 배치하고, 반드시 사용해야 하는 사실을 깊은 중간 영역에 묻지 마세요.
연결 순서의 우연에 맡기지 말고 의도적으로 위치를 관리하세요.
긴 컨텍스트 회수 검증
모델이 깊숙이 묻힌 사실을 사용했다고 절대 가정하지 마세요. 직접 확인하세요. 정해진 깊이에 알려진 검사용 사실을 삽입하고 이를 요청해 보세요. 프로덕션 환경에서 신뢰하기 전에 깊이별 회수율을 측정하여 여러분의 프롬프트 구조에서 여러분의 모델이 어떻게 작동하는지 파악하세요.
canary = 'The internal code name is BLUE_HERON.'
# Place at depth d, then ask: 'What is the internal code name?'
# Sweep d across the window to map recall vs position.축적보다 압축
장시간 에이전트 세션에서 컨텍스트가 제한 없이 커지게 두지 마세요. 주기적으로 압축하세요. 오래된 대화 차례를 조밀한 상태 객체로 요약하고 원시 기록은 삭제하세요. 이렇게 하면 핵심 정보를 보존하면서 예산을 되찾고 희석을 줄일 수 있습니다.
축적은 기본 동작이자 함정이고, 압축은 규율입니다.
state = summarize(old_turns) # dense facts, decisions, open items
context = [system, state] + recent_turns혼합형 아키텍처
가장 강력한 설계는 여러 전략을 결합합니다. 집중된 후보 집합을 검색하고, 의도적으로 배치하며, 안정적인 앞부분을 캐시에 저장하고, 대화를 압축합니다. 긴 컨텍스트는 예산 관리 도구 모음의 한 도구일 뿐, 엔지니어링을 대체하지 않습니다.
- 줄이기 위해 검색하세요.
- 드러내기 위해 배치하세요.
- 비용을 낮추기 위해 캐시에 저장하세요.
- 지속하기 위해 압축하세요.
판단 기준
전체 창을 사용하기 전에 다음을 자문하세요.
- 작업에 전체적 추론이 필요한가요, 아니면 특정 항목 하나가 필요한가요? 특정 항목이면 검색하세요.
- 관련된 부분의 비율이 작고 안정적인가요? 그렇다면 검색하거나 캐시에 저장하세요.
- 거대한 사전 입력 처리의 지연 시간과 비용을 감당할 수 있나요? 아니라면 줄이세요.
- 의존하는 깊이에서 회수 성능을 검증했나요? 아직 검증하지 않았다면 먼저 확인하세요.
용량은 허용 범위일 뿐 계획이 아닙니다.
빠른 확인
정적인 40,000페이지 아카이브에서 대략 3페이지에만 있는 좁은 범위의 사실 질문 하나에 답해야 하며, 이 질의를 하루에 수천 번 실행하게 됩니다.
복습: 백만 토큰 컨텍스트 창
거대한 창은 공짜로 모든 것을 기억하는 공간이 아니라 균일하지 않은 예산입니다. 실제로 사용할 수 있는 컨텍스트는 용량보다 작고, 지연 시간과 비용은 입력에 따라 증가하며, 관련 없는 자료는 정확도를 떨어뜨립니다. 전역적인 종합에는 긴 컨텍스트를, 핵심 정보 검색에는 검색을, 나머지에는 하이브리드 방식을 사용하십시오. 이때 중요한 콘텐츠를 회상률이 높은 영역에 배치하고, 안정적인 접두사를 캐싱하며, 긴 세션을 압축하고, 묻힌 사실을 신뢰하기 전에 항상 회상을 probe하십시오.
자주 묻는 질문
“백만 토큰 컨텍스트 창” 강의는 무료인가요?
네 — “백만 토큰 컨텍스트 창” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
“백만 토큰 컨텍스트 창”에서 뭘 배우나요?
기회와 주의할 점 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“백만 토큰 컨텍스트 창” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 백만 토큰 컨텍스트 창
- 중간 내용이 잊히는 현상
- 대규모 프롬프트 구조화
- 긴 접두사 캐싱