프롬프트와 결과 캐싱(Anthropic, Vertex)
Anthropic 프롬프트 캐싱과 Vertex 캐싱을 사용하면 길고 반복되는 시스템 프롬프트의 입력 비용을 10분의 1로 줄일 수 있습니다.
프롬프트와 결과 캐싱(Anthropic, Vertex)은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
캐시를 사용하는 이유
많은 에이전트 호출은 거의 동일합니다. 시스템 프롬프트와 소수 예시가 같고 사용자 입력만 다릅니다. 캐싱하지 않으면 호출할 때마다 정적인 부분을 다시 처리해야 합니다.
캐싱을 사용하면 입력 토큰 비용을 10분의 1까지 줄일 수 있습니다.
두 가지 캐싱 방식
- 프롬프트 캐싱(서버 측) — 제공업체가 반복되는 접두사의 모델 KV 상태를 캐시합니다
- 결과 캐싱(클라이언트 측) — 코드가 동일한 입력에 대한 전체 응답을 캐시합니다
Anthropic 프롬프트 캐싱
cache_control을 사용해 캐시할 부분을 표시하세요.
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
system=[
{'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
],
messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input cost캐시 적중률
응답의 사용량 객체를 확인하세요.
response.usage.cache_creation_input_tokens # tokens cached this call
response.usage.cache_read_input_tokens # tokens read from cache캐시할 대상
- 1,000토큰을 초과하는 시스템 프롬프트
- 도구 정의
- 소수 예시
- 질의 간에 공유되는 RAG 문맥(드묾)
캐시 표시 위치
캐시 제어는 마지막 정적 블록에 있어야 합니다. 표시 앞에 있는 모든 내용이 캐시됩니다. 안정적인 내용은 앞에, 가변적인 내용은 뒤에 배치하세요.
OpenAI 프롬프트 캐싱
OpenAI는 1,024토큰을 초과하는 프롬프트를 자동으로 캐시합니다. 명시적인 표시가 필요하지 않습니다.
# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokensVertex AI 문맥 캐싱
Google Vertex에서는 캐시 객체를 명시적으로 생성해야 합니다.
from vertexai.generative_models import GenerativeModel, content_cache
cache = content_cache.CachedContent.create(
model='gemini-1.5-pro',
contents=[long_system_content],
ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)클라이언트 측 결과 캐시
정확히 일치하는 질의(동일한 입력과 동일하게 예상되는 출력)에는 키-값 캐시를 사용하세요.
import hashlib
def cache_key(model, messages):
return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()
def cached_call(model, messages):
key = cache_key(model, messages)
if cached := redis.get(key):
return json.loads(cached)
result = real_call(model, messages)
redis.set(key, json.dumps(result), ex=3600)
return result의미 기반 캐시
임베딩을 사용해 동일하지는 않지만 유사한 질의를 캐시하세요.
qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
return matches[0].metadata['cached_response']캐시 무효화
오래된 캐시는 잘못된 답변을 반환합니다. 전략은 다음과 같습니다.
- TTL — 시간에 민감한 데이터에는 짧게 설정
- 데이터가 업데이트될 때 수동으로 무효화
- 사용자별 키를 사용해 업데이트가 한 사용자에게만 영향을 주도록 설정
개인 맞춤형 응답은 캐시하지 마세요
“내 잔액은 얼마인가요?”와 같은 응답은 사용자 간에 캐시할 수 없습니다. 여러 테넌트가 사용하는 시스템에서 공유 캐시를 사용할 때는 주의하세요.
캐시 비용과 LLM 비용 비교
Redis 비용은 LLM 비용에 비하면 무시할 수 있을 정도로 작습니다. 적극적으로 캐시하세요. 적중률이 10%만 되어도 실제 비용을 절약할 수 있습니다.
실제 비용 절감
공유되는 긴 시스템 프롬프트와 프롬프트 캐싱을 사용하면 운영 환경에서 입력 비용이 50~90% 감소하는 경우가 흔합니다. ROI가 가장 높은 최적화 방법 중 하나입니다.
Anthropic 캐시 활성화
Anthropic에서 프롬프트 캐싱을 활성화하려면 어떻게 해야 하나요?
복습
정적 접두사에는 서버 측 프롬프트 캐싱을, 정확히 일치하는 항목에는 클라이언트 측 KV 캐시를, 유사한 항목에는 의미 기반 캐시를 사용하세요. 항상 적중률과 절감액을 확인하세요.
자주 묻는 질문
“프롬프트와 결과 캐싱(Anthropic, Vertex)” 강의는 무료인가요?
네 — “프롬프트와 결과 캐싱(Anthropic, Vertex)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“프롬프트와 결과 캐싱(Anthropic, Vertex)”에서 뭘 배우나요?
Anthropic 프롬프트 캐싱과 Vertex 캐싱을 사용하면 길고 반복되는 시스템 프롬프트의 입력 비용을 10분의 1로 줄일 수 있습니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“프롬프트와 결과 캐싱(Anthropic, Vertex)” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 단계별 토큰 예산
- 모델 라우팅(저렴한 모델 -> 비싼 모델)
- 프롬프트와 결과 캐싱(Anthropic, Vertex)
- 양자화와 추측 디코딩