LLM Apps in Production (RAG + Vector DB + Caching) · Leçon

Tests de charge et planification de la capacité

Apprenez à simuler un trafic réaliste vers une application LLM, à trouver son point de rupture et à planifier sa capacité afin que la production reste rapide et respecte le budget sous forte charge.

Leçon 4 sur 413 étapes

Tests de charge et planification de la capacité est une leçon LLM Apps in Production (RAG + Vector DB + Caching) gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage LLM Apps in Production (RAG + Vector DB + Caching), et ta progression se synchronise sur le web et l'application CoddyKit. Le cours LLM Apps in Production (RAG + Vector DB + Caching) comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Why Load Test LLM Apps?

LLM apps behave differently under load than typical web services: token generation is slow, requests are long-lived, and upstream provider rate limits add a hard ceiling.

Load testing reveals how your system degrades before real users do.

Key Metrics

Track these under load:

  • Throughput — requests or tokens per second
  • Latency percentiles — p50, p95, p99
  • Error rate — timeouts, 429s
  • Time to first token for streaming

Open vs Closed Load Models

Two ways to generate load:

  • Closed — fixed number of virtual users, each waits for a response before sending the next
  • Open — requests arrive at a fixed rate regardless of responses

Open-model tests better expose queue buildup.

Realistic Workloads

Use realistic prompts. A test with tiny prompts hides cost; production prompts include long retrieved context. Sample real queries and vary input length to mimic actual token distributions.

Percentile Latency in Code

Averages lie; percentiles tell the truth about tail latency.

def percentile(values, p):
    s = sorted(values)
    idx = int(round((p/100) * (len(s)-1)))
    return s[idx]

lat = [120, 130, 140, 900, 150]
print('p95 =', percentile(lat, 95))

Finding the Breaking Point

Ramp the request rate gradually until latency or error rate crosses your SLO. That inflection point is your saturation capacity. Run below it in production with headroom.

Estimating Required Capacity

Use Little's Law: concurrency = arrival rate x average latency. Estimate how many concurrent slots you need for peak traffic.

def concurrency(rps, avg_latency_s):
    return rps * avg_latency_s

print('Need', concurrency(50, 2.0), 'concurrent slots')

Accounting for Provider Limits

Your effective capacity may be capped by the LLM provider's tokens-per-minute and requests-per-minute limits, not your servers. Plan around those quotas and request increases ahead of launches.

Headroom and Autoscaling

Run at a target utilization (often 60-70 percent) so spikes do not immediately saturate. Configure autoscaling on a leading signal like queue depth, since CPU is a poor proxy for LLM load.

Soak and Spike Tests

Beyond steady ramps, run:

  • Soak — sustained load for hours to catch leaks
  • Spike — sudden surge to test autoscaling reaction

From Test to Plan

Turn results into a capacity plan: peak rps, required concurrency, provider quota needs, scaling rules, and a cost estimate. Re-test after major changes since model and prompt changes shift the numbers.

Quick Check

Test your understanding of capacity planning.

Recap

You learned to load test LLM apps with realistic workloads, track latency percentiles and error rate, find the saturation point, and size capacity with Little's Law. Account for provider quotas, keep headroom, autoscale on queue depth, and run soak and spike tests.

Gratuit pour commencer

Apprends LLM Apps in Production (RAG + Vector DB + Caching) avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
12
Leçons
48

Questions Fréquemment Posées

La leçon « Tests de charge et planification de la capacité » est-elle gratuite ?

Oui — le texte complet de « Tests de charge et planification de la capacité » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours LLM Apps in Production (RAG + Vector DB + Caching), passe à CoddyKit PRO. Le cours LLM Apps in Production (RAG + Vector DB + Caching) comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Tests de charge et planification de la capacité » ?

Apprenez à simuler un trafic réaliste vers une application LLM, à trouver son point de rupture et à planifier sa capacité afin que la production reste rapide et respecte le budget sous forte charge. Tu pratiques LLM Apps in Production (RAG + Vector DB + Caching) avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer LLM Apps in Production (RAG + Vector DB + Caching) ?

Aucune expérience préalable n'est requise. LLM Apps in Production (RAG + Vector DB + Caching) sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Tests de charge et planification de la capacité » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon LLM Apps in Production (RAG + Vector DB + Caching) ?

Oui. Chaque leçon LLM Apps in Production (RAG + Vector DB + Caching) inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Mise à l’échelle horizontale des composants RAG
  2. Observabilité : journaux, indicateurs et traçage
  3. Alertes et réponse aux incidents pour l’exploitation des LLM
  4. Tests de charge et planification de la capacité
← Retour à LLM Apps in Production (RAG + Vector DB + Caching)