AI-agenter · Lektion

Modellrouting (billig → dyr)

Prova först en liten modell och växla till en frontier-modell bara när den lilla modellen misslyckas eller har låg konfidens.

Lektion 2 av 415 steg

Modellrouting (billig → dyr) är en gratis lektion i AI-agenter på CoddyKit. Detta är lektion 2 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för AI-agenter, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i AI-agenter innehåller totalt 4 lektioner.

Delar av den här lektionen har ännu inte översatts och visas på engelska.

Använd inte stora modeller för enkla uppgifter

Att anropa GPT-4o för "är detta e-postmeddelande skräppost?" slösar pengar. Skicka enkla uppgifter till billiga modeller och svåra uppgifter till dyra modeller.

Routningsmönstret

  1. Prova först en liten och billig modell
  2. Om utdatan har låg konfidens eller inte klarar valideringen, eskalera till en stor modell
  3. Logga vilken väg som valdes

Confidence-Based Routing

cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
    return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)

Valideringsbaserad routning

Om den billiga modellens utdata inte klarar schemavalideringen eskalerar man:

try:
    result = Schema.model_validate_json(cheap_response.content)
    return result
except ValidationError:
    return Schema.model_validate_json(call('gpt-4o', messages).content)

Val av modell per steg

Olika delar av en agent behöver olika modeller:

MODEL_BY_STEP = {
    'classify_intent': 'gpt-4o-mini',     # easy
    'plan': 'gpt-4o',                     # critical
    'extract': 'gpt-4o-mini',             # routine
    'write_response': 'claude-sonnet-4-5' # quality matters
}

# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
    print(f'{step:16s} -> {MODEL_BY_STEP[step]}')

Routning mellan leverantörer

Använd Groq för låg latens, OpenAI för kvalitet och Anthropic för lång kontext:

if need_low_latency:
    return call_groq('llama-3.1-70b')
elif need_long_context:
    return call_anthropic('claude-sonnet-4-5')
else:
    return call_openai('gpt-4o-mini')

LLM som router

En liten modell klassificerar förfrågan och väljer nästa modell:

router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
    return call('gpt-4o-mini', user_msg)
else:
    return call('gpt-4o', user_msg)

Reservkedja

Om den primära modellen misslyckas (på grund av hastighetsbegränsning eller fel) provar man den sekundära:

for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
    try:
        return call(model, messages)
    except RateLimitError:
        continue
raise AllModelsFailed()

Embeddingbaserad routning

Skapa en embedding av frågan. Om den liknar ett känt enkelt fall används en billig modell, annars en stor modell:

embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
    use_cheap_model()

Exempel på routningshierarki

NivåKostnadAnvändning
Nivå 1$ — Llama 8BKlassificering, extrahering
Nivå 2$$ — gpt-4o-miniVanliga agentsteg
Nivå 3$$$ — gpt-4o / claudeSvåra resonemang, slutlig syntes

Mät nettobesparingen

Följ upp:

  • Andelen förfrågningar som hanteras av varje nivå
  • Kvaliteten (andelen godkända utvärderingar) per nivå
  • Total kostnad per förfrågan

Jämför med baslinjen (alltid den stora modellen) för att kontrollera att routningen ger resultat.

Kalibrera konfidensen

Självrapporterad konfidens är opålitlig. Kalibrera mot en utvärderingsuppsättning. Om modellen anger 90 % men bara har rätt 60 % av gångerna bör tröskeln justeras.

Routrar med öppen källkod

RouteLLM (LMSYS) är ett OSS-ramverk för tränade modellroutrar. Det är värt att utforska om routning är avgörande för kostnadsstrukturen.

Routningsstrategi

Vilken är den enklaste och mest effektiva routningsstrategin?

Sammanfattning

Modeller i nivåer, billiga modeller först med eskalering, routning per steg och reservkedjor. Mät fördelningen mellan nivåerna och kvaliteten. Routning är den enskilt viktigaste kostnadsspaken i produktion.

Gratis att börja

Lär dig AI-agenter med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
60
Lektioner
239

Vanliga frågor

Är lektionen ”Modellrouting (billig → dyr)” gratis?

Ja – hela texten till ”Modellrouting (billig → dyr)” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i AI-agenter, kan Ni uppgradera till CoddyKit PRO. Kursen i AI-agenter innehåller totalt 4 lektioner.

Vad lär jag mig i ”Modellrouting (billig → dyr)”?

Prova först en liten modell och växla till en frontier-modell bara när den lilla modellen misslyckas eller har låg konfidens. Ni övar på AI-agenter med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig AI-agenter?

Du behöver inga förkunskaper. Utbildningen i AI-agenter på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.

Hur lång tid tar lektionen ”Modellrouting (billig → dyr)”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här AI-agenter-lektionen?

Ja. Varje AI-agenter-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Tokenbudgetar per steg
  2. Modellrouting (billig → dyr)
  3. Cachning av promptar och resultat (Anthropic, Vertex)
  4. Kvantisering och spekulativ avkodning
← Tillbaka till AI-agenter