Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
O armazenamento em cache de instruções da Anthropic e do Vertex reduz em 10 vezes o custo de entrada em instruções de sistema longas e repetidas.
Armazenamento em cache de instruções e resultados (Anthropic, Vertex) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Por que usar cache?
Muitas chamadas de agentes são quase idênticas: a mesma instrução do sistema, os mesmos exemplos de poucos disparos e uma entrada de usuário diferente. Sem cache, você reprocessa as partes estáticas em cada chamada.
O cache pode reduzir em 10 vezes o custo dos tokens de entrada.
Dois tipos de cache
- Cache de instruções (no servidor) — o provedor armazena o estado KV do modelo para prefixos repetidos
- Cache de resultados (no cliente) — seu código armazena respostas completas para entradas idênticas
Cache de instruções do Anthropic
Marque as partes que podem ser armazenadas em cache com cache_control:
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
system=[
{'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
],
messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input costTaxa de acertos do cache
Verifique o objeto de uso da resposta:
response.usage.cache_creation_input_tokens # tokens cached this call
response.usage.cache_read_input_tokens # tokens read from cacheO que armazenar em cache
- Instruções do sistema com mais de 1 mil tokens
- Definições de ferramentas
- Exemplos de poucos disparos
- Contexto de RAG compartilhado entre consultas (raramente)
Onde colocar os marcadores de cache
O controle de cache deve estar no último bloco estático, indicado por LAST. Tudo que vem antes do marcador é armazenado em cache. Coloque o conteúdo estável no início e o conteúdo variável no final.
Cache de instruções do OpenAI
O OpenAI armazena automaticamente em cache instruções com mais de 1024 tokens. Não há marcador explícito:
# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokensCache de contexto do Vertex AI
O Google Vertex exige que você crie explicitamente um objeto de cache:
from vertexai.generative_models import GenerativeModel, content_cache
cache = content_cache.CachedContent.create(
model='gemini-1.5-pro',
contents=[long_system_content],
ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)Cache de resultados no cliente
Para consultas com correspondência exata (mesma entrada, mesma saída esperada), use um cache de chave-valor:
import hashlib
def cache_key(model, messages):
return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()
def cached_call(model, messages):
key = cache_key(model, messages)
if cached := redis.get(key):
return json.loads(cached)
result = real_call(model, messages)
redis.set(key, json.dumps(result), ex=3600)
return resultCache semântico
Use embeddings para armazenar em cache consultas semelhantes (não idênticas):
qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
return matches[0].metadata['cached_response']Invalidação do cache
Caches desatualizados retornam respostas erradas. Estratégias:
- TTL — curto para dados sensíveis ao tempo
- Invalidação manual quando os dados forem atualizados
- Chaves por usuário, para que as atualizações afetem apenas um usuário
Não armazene respostas personalizadas em cache
"Qual é o meu saldo?" não pode ser armazenado em cache entre usuários. Tenha cuidado com caches compartilhados em sistemas multi-inquilino.
Custo do cache versus custo do LLM
Os custos do Redis são insignificantes em comparação com os custos do LLM. Use o cache de forma agressiva — até uma taxa de acertos de 10% economiza dinheiro de verdade.
Economia no mundo real
Com instruções de sistema longas e compartilhadas e cache de instruções, as equipes normalmente observam uma redução de 50–90% no custo de entrada em produção. É uma das otimizações com maior ROI.
Ativação do cache do Anthropic
Como ativar o cache de instruções com o Anthropic?
Recapitulação
Cache de instruções no servidor para prefixos estáticos; cache KV no cliente para correspondência exata; cache semântico para correspondência aproximada. Sempre verifique as taxas de acertos e a economia.
Aprenda AI Agents com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 60
- Aulas
- 239
Perguntas Frequentes
A aula “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)” é grátis?
Sim — o texto completo de “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)”?
O armazenamento em cache de instruções da Anthropic e do Vertex reduz em 10 vezes o custo de entrada em instruções de sistema longas e repetidas. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Orçamentos de tokens por etapa
- Roteamento de modelos (barato -> caro)
- Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
- Quantização e decodificação especulativa