AI-agenter med LangChain och autonoma arbetsflöden · Lektion

Rate limiting och hantering av API-kvoter

Skydda agenter i produktion mot leverantörers rate limits och skenande kostnader genom att strypa requests, försöka igen med backoff och hantera kvoter per användare.

Lektion 4 av 413 steg

Rate limiting och hantering av API-kvoter är en gratis lektion i AI-agenter med LangChain och autonoma arbetsflöden på CoddyKit. Detta är lektion 4 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för AI-agenter med LangChain och autonoma arbetsflöden, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i AI-agenter med LangChain och autonoma arbetsflöden innehåller totalt 4 lektioner.

Begränsningarna du möter

LLM-leverantörer begränsar användningen på två sätt:

  • Requests per minute (RPM)
  • Tokens per minute (TPM)

Om du överskrider dem returnerar anropen 429 Too Many Requests, vilket gör att dina agenter slutar fungera under hög belastning.

Varför du bör begränsa proaktivt

Det är ineffektivt att vänta på 429-fel och försöka igen. Proaktiv hastighetsbegränsning sprider ut anropen så att du håller dig under gränsen, jämnar ut trafiken och helt undviker fel.

Hastighetsbegränsning på klientsidan

LangChain kan begränsa modell-anrop med en inbyggd hastighetsbegränsare som släpper igenom ett fast antal anrop per sekund.

from langchain_core.rate_limiters import InMemoryRateLimiter

limiter = InMemoryRateLimiter(
    requests_per_second=2,
    max_bucket_size=5
)

Koppla den till modellen

Skicka begränsaren till chatmodellen. Nu väntar varje anrop automatiskt på sin tur.

llm = ChatOpenAI(
    model='gpt-4o-mini',
    rate_limiter=limiter
)

Försök igen med exponentiell backoff

Vissa 429-fel och tillfälliga fel går inte att undvika. Försök igen med gradvis längre fördröjningar så att du inte överbelastar leverantören.

llm_with_retry = llm.with_retry(
    stop_after_attempt=5
)

Följ Retry-After

Leverantörer returnerar ofta en Retry-After-header som anger hur länge du ska vänta. Att följa den är artigare och effektivare än att använda en fast fördröjning.

wait = int(response.headers.get('Retry-After', '1'))

Kvoter per användare

Utöver leverantörernas gränser ställer Ni in egna kvoter per användare för att kontrollera kostnader och rättvisa. Spåra användningen i ett datalager som Redis och avvisa eller köa förfrågningar när en användare överskrider sin tilldelning.

used = redis.incr(f'quota:{user_id}')
if used > DAILY_LIMIT:
    raise QuotaExceeded()

Token bucket-algoritmen

Det vanligaste mönstret är en token bucket: tokens fylls på i en jämn takt, varje förfrågan förbrukar en token och en tom bucket innebär att man måste vänta. Det tillåter korta toppar samtidigt som den genomsnittliga takten begränsas.

Köbildning under belastning

När efterfrågan ökar och överskrider era gränser bör Ni köa förfrågningar i stället för att kasta bort dem. En bakgrundsarbetare tömmer kön i en säker takt, vilket håller systemet stabilt.

Fördela över nycklar

För hög genomströmning kan Ni växla mellan flera API-nycklar eller leverantörer och fördela belastningen så att ingen enskild nyckel når sitt tak. Spåra användningen för varje nyckel separat.

Övervaka gränser

Spåra 429-frekvensen och hur nära taken Ni ligger. Fler 429-fel signalerar att Ni behöver en högre nivå, bättre strypning eller fler nycklar innan användarna märker av problemen.

Snabbtest

Testa era kunskaper om hastighetsbegränsning.

Sammanfattning

Ni har lärt Er att hantera gränser och kvoter i produktion:

  • Leverantörer begränsar RPM och TPM; 429-fel stör agenter
  • Använd InMemoryRateLimiter för att strypa trafiken proaktivt
  • Lägg till återförsök med backoff och respektera Retry-After
  • Tillämpa kvoter per användare med en token bucket
  • Köa, växla mellan nycklar och övervaka 429-frekvensen

God hantering av gränser gör agenter i stor skala tillförlitliga och kostnadseffektiva.

Gratis att börja

Lär dig AI-agenter med LangChain och autonoma arbetsflöden med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
12
Lektioner
50

Vanliga frågor

Är lektionen ”Rate limiting och hantering av API-kvoter” gratis?

Ja – hela texten till ”Rate limiting och hantering av API-kvoter” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i AI-agenter med LangChain och autonoma arbetsflöden, kan Ni uppgradera till CoddyKit PRO. Kursen i AI-agenter med LangChain och autonoma arbetsflöden innehåller totalt 4 lektioner.

Vad lär jag mig i ”Rate limiting och hantering av API-kvoter”?

Skydda agenter i produktion mot leverantörers rate limits och skenande kostnader genom att strypa requests, försöka igen med backoff och hantera kvoter per användare. Ni övar på AI-agenter med LangChain och autonoma arbetsflöden med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig AI-agenter med LangChain och autonoma arbetsflöden?

Du behöver inga förkunskaper. Utbildningen i AI-agenter med LangChain och autonoma arbetsflöden på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 4 av 4.

Hur lång tid tar lektionen ”Rate limiting och hantering av API-kvoter”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här AI-agenter med LangChain och autonoma arbetsflöden-lektionen?

Ja. Varje AI-agenter med LangChain och autonoma arbetsflöden-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Distribuera agenter till molnplattformar
  2. Hantera agenttillstånd och sessioner
  3. Skala agentarkitekturer
  4. Rate limiting och hantering av API-kvoter
← Tillbaka till AI-agenter med LangChain och autonoma arbetsflöden