AI Agents · Aula

Armazenamento em cache de instruções e resultados (Anthropic, Vertex)

O armazenamento em cache de instruções da Anthropic e do Vertex reduz em 10 vezes o custo de entrada em instruções de sistema longas e repetidas.

Aula 3 de 416 etapas

Armazenamento em cache de instruções e resultados (Anthropic, Vertex) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Por que usar cache?

Muitas chamadas de agentes são quase idênticas: a mesma instrução do sistema, os mesmos exemplos de poucos disparos e uma entrada de usuário diferente. Sem cache, você reprocessa as partes estáticas em cada chamada.

O cache pode reduzir em 10 vezes o custo dos tokens de entrada.

Dois tipos de cache

  1. Cache de instruções (no servidor) — o provedor armazena o estado KV do modelo para prefixos repetidos
  2. Cache de resultados (no cliente) — seu código armazena respostas completas para entradas idênticas

Cache de instruções do Anthropic

Marque as partes que podem ser armazenadas em cache com cache_control:

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=1024,
    system=[
        {'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
    ],
    messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input cost

Taxa de acertos do cache

Verifique o objeto de uso da resposta:

response.usage.cache_creation_input_tokens   # tokens cached this call
response.usage.cache_read_input_tokens       # tokens read from cache

O que armazenar em cache

  • Instruções do sistema com mais de 1 mil tokens
  • Definições de ferramentas
  • Exemplos de poucos disparos
  • Contexto de RAG compartilhado entre consultas (raramente)

Onde colocar os marcadores de cache

O controle de cache deve estar no último bloco estático, indicado por LAST. Tudo que vem antes do marcador é armazenado em cache. Coloque o conteúdo estável no início e o conteúdo variável no final.

Cache de instruções do OpenAI

O OpenAI armazena automaticamente em cache instruções com mais de 1024 tokens. Não há marcador explícito:

# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokens

Cache de contexto do Vertex AI

O Google Vertex exige que você crie explicitamente um objeto de cache:

from vertexai.generative_models import GenerativeModel, content_cache

cache = content_cache.CachedContent.create(
    model='gemini-1.5-pro',
    contents=[long_system_content],
    ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)

Cache de resultados no cliente

Para consultas com correspondência exata (mesma entrada, mesma saída esperada), use um cache de chave-valor:

import hashlib

def cache_key(model, messages):
    return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()

def cached_call(model, messages):
    key = cache_key(model, messages)
    if cached := redis.get(key):
        return json.loads(cached)
    result = real_call(model, messages)
    redis.set(key, json.dumps(result), ex=3600)
    return result

Cache semântico

Use embeddings para armazenar em cache consultas semelhantes (não idênticas):

qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
    return matches[0].metadata['cached_response']

Invalidação do cache

Caches desatualizados retornam respostas erradas. Estratégias:

  • TTL — curto para dados sensíveis ao tempo
  • Invalidação manual quando os dados forem atualizados
  • Chaves por usuário, para que as atualizações afetem apenas um usuário

Não armazene respostas personalizadas em cache

"Qual é o meu saldo?" não pode ser armazenado em cache entre usuários. Tenha cuidado com caches compartilhados em sistemas multi-inquilino.

Custo do cache versus custo do LLM

Os custos do Redis são insignificantes em comparação com os custos do LLM. Use o cache de forma agressiva — até uma taxa de acertos de 10% economiza dinheiro de verdade.

Economia no mundo real

Com instruções de sistema longas e compartilhadas e cache de instruções, as equipes normalmente observam uma redução de 50–90% no custo de entrada em produção. É uma das otimizações com maior ROI.

Ativação do cache do Anthropic

Como ativar o cache de instruções com o Anthropic?

Recapitulação

Cache de instruções no servidor para prefixos estáticos; cache KV no cliente para correspondência exata; cache semântico para correspondência aproximada. Sempre verifique as taxas de acertos e a economia.

Grátis para começar

Aprenda AI Agents com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
60
Aulas
239

Perguntas Frequentes

A aula “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)” é grátis?

Sim — o texto completo de “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)”?

O armazenamento em cache de instruções da Anthropic e do Vertex reduz em 10 vezes o custo de entrada em instruções de sistema longas e repetidas. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Armazenamento em cache de instruções e resultados (Anthropic, Vertex)”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Orçamentos de tokens por etapa
  2. Roteamento de modelos (barato -> caro)
  3. Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
  4. Quantização e decodificação especulativa
← Voltar para AI Agents