Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)
La caché de prompts de Anthropic y la caché de Vertex reducen diez veces el coste de entrada en prompts de sistema largos y repetidos.
Almacenamiento en caché de prompts y resultados (Anthropic, Vertex) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
¿Por qué usar caché?
Muchas llamadas de agentes son casi idénticas: el mismo prompt del sistema, los mismos ejemplos few-shot y una entrada de usuario diferente. Sin almacenamiento en caché, debe volver a procesar las partes estáticas en cada llamada.
El almacenamiento en caché puede reducir 10 veces el coste de los tokens de entrada.
Dos tipos de almacenamiento en caché
- Almacenamiento en caché de prompts (del lado del servidor): el proveedor guarda en caché el estado KV del modelo para prefijos repetidos
- Almacenamiento en caché de resultados (del lado del cliente): su código guarda en caché las respuestas completas para entradas idénticas
Almacenamiento en caché de prompts de Anthropic
Marque las partes que se pueden almacenar en caché con cache_control:
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
system=[
{'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
],
messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input costProporción de aciertos de caché
Compruebe el objeto usage de la respuesta:
response.usage.cache_creation_input_tokens # tokens cached this call
response.usage.cache_read_input_tokens # tokens read from cacheQué almacenar en caché
- Prompts del sistema de más de 1k tokens
- Definiciones de herramientas
- Ejemplos few-shot
- Contexto de RAG compartido entre consultas (poco habitual)
Dónde colocar los marcadores de caché
El control de caché debe estar en el ÚLTIMO bloque estático. Todo lo que aparezca antes del marcador se almacena en caché. Coloque el contenido estable al principio y el contenido variable al final.
Almacenamiento en caché de prompts de OpenAI
OpenAI almacena automáticamente en caché los prompts de más de 1024 tokens. No se necesita ningún marcador explícito:
# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokensAlmacenamiento en caché de contexto de Vertex AI
Google Vertex requiere que cree explícitamente un objeto de caché:
from vertexai.generative_models import GenerativeModel, content_cache
cache = content_cache.CachedContent.create(
model='gemini-1.5-pro',
contents=[long_system_content],
ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)Caché de resultados del lado del cliente
Para consultas de coincidencia exacta (misma entrada y misma salida esperada), use una caché de clave-valor:
import hashlib
def cache_key(model, messages):
return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()
def cached_call(model, messages):
key = cache_key(model, messages)
if cached := redis.get(key):
return json.loads(cached)
result = real_call(model, messages)
redis.set(key, json.dumps(result), ex=3600)
return resultCaché semántica
Use embeddings para almacenar en caché consultas similares (no idénticas):
qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
return matches[0].metadata['cached_response']Invalidación de caché
Las cachés obsoletas devuelven respuestas incorrectas. Estrategias:
- TTL: corto para datos sensibles al tiempo
- Invalidación manual cuando se actualicen los datos
- Claves por usuario para que las actualizaciones solo afecten a un usuario
No almacene en caché respuestas personalizadas
«¿Cuál es mi saldo?» no se puede almacenar en caché para varios usuarios. Tenga cuidado con las cachés compartidas en sistemas multiinquilino.
Coste de la caché frente al coste del LLM
El coste de Redis es insignificante frente al de los LLM. Almacene todo lo posible en caché: incluso una tasa de aciertos del 10 % supone un ahorro real.
Ahorro en el mundo real
Con prompts del sistema compartidos y largos, junto con el almacenamiento en caché de prompts, los equipos suelen observar una reducción del 50 al 90 % en el coste de entrada en producción. Es una de las optimizaciones con mayor retorno de la inversión.
Activador de caché de Anthropic
¿Cómo se activa el almacenamiento en caché de prompts con Anthropic?
Resumen
Almacenamiento en caché de prompts del lado del servidor para prefijos estáticos; caché KV del lado del cliente para coincidencias exactas; caché semántica para coincidencias aproximadas. Compruebe siempre las tasas de aciertos y el ahorro.
Preguntas frecuentes
¿La lección «Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)» es gratis?
Sí — el texto completo de «Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)»?
La caché de prompts de Anthropic y la caché de Vertex reducen diez veces el coste de entrada en prompts de sistema largos y repetidos. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.
¿Cuánto tiempo toma la lección «Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Presupuestos de tokens por paso
- Enrutamiento de modelos (barato -> caro)
- Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)
- Cuantización y decodificación especulativa