AI Agents · Leçon

Mise en cache des invites et des résultats (Anthropic, Vertex)

La mise en cache des invites Anthropic et la mise en cache Vertex réduisent de dix fois le coût d’entrée pour les longues invites système répétées.

Leçon 3 sur 416 étapes

Mise en cache des invites et des résultats (Anthropic, Vertex) est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Pourquoi utiliser un cache ?

De nombreux appels d’agents sont presque identiques : même invite système, mêmes exemples en contexte, entrée utilisateur différente. Sans mise en cache, vous retraitez les parties statiques à chaque appel.

La mise en cache peut réduire de dix fois le coût des jetons d’entrée.

Deux types de mise en cache

  1. Mise en cache des invites (côté serveur) — le fournisseur met en cache l’état KV du modèle pour les préfixes répétés
  2. Mise en cache des résultats (côté client) — votre code met en cache les réponses complètes pour les entrées identiques

Mise en cache des invites avec Anthropic

Marquez les parties pouvant être mises en cache avec cache_control :

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=1024,
    system=[
        {'type': 'text', 'text': LONG_SYSTEM_PROMPT, 'cache_control': {'type': 'ephemeral'}}
    ],
    messages=[{'role': 'user', 'content': user_input}]
)
# 1st call: full price
# 2nd call within 5min: 10% of input cost

Taux de réussite du cache

Vérifiez l’objet d’utilisation de la réponse :

response.usage.cache_creation_input_tokens   # tokens cached this call
response.usage.cache_read_input_tokens       # tokens read from cache

Éléments à mettre en cache

  • Invites système de plus de 1 000 jetons
  • Définitions des outils
  • Exemples en contexte
  • Contexte RAG partagé entre les requêtes (rare)

Où placer les marqueurs du cache

Le contrôle du cache doit se trouver sur le dernier bloc statique. Tout ce qui précède le marqueur est mis en cache. Placez le contenu stable au début et le contenu variable à la fin.

Mise en cache des invites avec OpenAI

OpenAI met automatiquement en cache les invites de plus de 1 024 jetons. Aucun marqueur explicite n’est nécessaire :

# Just send the same prefix repeatedly. Cache discount applies automatically.
# Check response.usage.prompt_tokens_details.cached_tokens

Mise en cache du contexte avec Vertex AI

Google Vertex vous impose de créer explicitement un objet de cache :

from vertexai.generative_models import GenerativeModel, content_cache

cache = content_cache.CachedContent.create(
    model='gemini-1.5-pro',
    contents=[long_system_content],
    ttl=300
)
model = GenerativeModel.from_cached_content(cache)
response = model.generate_content(user_input)

Cache de résultats côté client

Pour les requêtes à correspondance exacte (même entrée, même sortie attendue), utilisez un cache clé-valeur :

import hashlib

def cache_key(model, messages):
    return hashlib.sha256(f'{model}:{json.dumps(messages)}'.encode()).hexdigest()

def cached_call(model, messages):
    key = cache_key(model, messages)
    if cached := redis.get(key):
        return json.loads(cached)
    result = real_call(model, messages)
    redis.set(key, json.dumps(result), ex=3600)
    return result

Cache sémantique

Utilisez des plongements pour mettre en cache des requêtes similaires, mais non identiques :

qvec = embed(query)
matches = vector_db.query(qvec, k=1)
if matches and matches[0].score > 0.95:
    return matches[0].metadata['cached_response']

Invalidation du cache

Les caches obsolètes renvoient de mauvaises réponses. Stratégies :

  • TTL — durée courte pour les données sensibles au temps
  • Invalidation manuelle lors des mises à jour des données
  • Clés propres à chaque utilisateur afin que les mises à jour ne touchent qu’un seul utilisateur

Ne mettez pas en cache les réponses personnalisées

« Quel est mon solde ? » ne peut pas être mis en cache entre les utilisateurs. Soyez prudent avec les caches partagés dans les systèmes mutualisés.

Coût du cache par rapport à celui du LLM

Le coût de Redis est négligeable par rapport à celui des LLM. Mettez largement en cache : même un taux de réussite de 10 % permet d’économiser une somme réelle.

Économies en conditions réelles

Avec de longues invites système partagées et la mise en cache des invites, les équipes constatent régulièrement une baisse de 50 à 90 % du coût des entrées en production. Il s’agit de l’une des optimisations au meilleur ROI.

Déclencheur du cache Anthropic

Comment activez-vous la mise en cache des invites avec Anthropic ?

Récapitulatif

Mise en cache des invites côté serveur pour les préfixes statiques ; cache KV côté client pour les correspondances exactes ; cache sémantique pour les correspondances approximatives. Vérifiez toujours les taux de réussite et les économies.

Gratuit pour commencer

Apprends AI Agents avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
60
Leçons
239

Questions Fréquemment Posées

La leçon « Mise en cache des invites et des résultats (Anthropic, Vertex) » est-elle gratuite ?

Oui — le texte complet de « Mise en cache des invites et des résultats (Anthropic, Vertex) » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Mise en cache des invites et des résultats (Anthropic, Vertex) » ?

La mise en cache des invites Anthropic et la mise en cache Vertex réduisent de dix fois le coût d’entrée pour les longues invites système répétées. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Mise en cache des invites et des résultats (Anthropic, Vertex) » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Budgets de jetons par étape
  2. Routage des modèles (économique → coûteux)
  3. Mise en cache des invites et des résultats (Anthropic, Vertex)
  4. Quantification et décodage spéculatif
← Retour à AI Agents