Modell-Routing (günstig -> teuer)
Versuchen Sie es zuerst mit einem kleinen Modell und wechseln Sie nur dann zu einem Frontier-Modell, wenn das kleine Modell scheitert oder eine geringe Konfidenz hat.
Modell-Routing (günstig -> teuer) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
Verwenden Sie keine großen Modelle für einfache Aufgaben
GPT-4o für „Ist diese E-Mail Spam?“ aufzurufen, verschwendet Geld. Leiten Sie einfache Aufgaben an günstige Modelle und schwierige Aufgaben an teure Modelle weiter.
Das Routing-Muster
- Versuchen Sie zuerst ein kleines oder günstiges Modell
- Wenn die Ausgabe wenig Vertrauen erweckt oder die Validierung fehlschlägt, wechseln Sie zu einem großen Modell
- Protokollieren Sie, welcher Pfad verwendet wurde
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Routing nach Validierung
Wenn die Ausgabe des günstigen Modells die Schema-Validierung nicht besteht, wechseln Sie zu einem größeren Modell:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Modellauswahl pro Schritt
Für unterschiedliche Teile eines Agenten werden unterschiedliche Modelle benötigt:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Routing über verschiedene Anbieter
Verwenden Sie Groq für geringe Latenz, OpenAI für Qualität und Anthropic für lange Kontexte:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM als Router
Ein kleines Modell klassifiziert die Anfrage und wählt das nächste Modell aus:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Fallback-Kette
Wenn das primäre Modell fehlschlägt, etwa wegen eines Rate-Limits oder eines Fehlers, versuchen Sie es mit dem sekundären Modell:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Embedding-basiertes Routing
Erstellen Sie ein Embedding für die Anfrage. Wenn sie einem bekannten einfachen Fall ähnelt, verwenden Sie das günstige Modell; andernfalls das große Modell:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Beispiel für eine Routing-Hierarchie
| Stufe | Kosten | Verwendung |
|---|---|---|
| Stufe 1 | $ — Llama 8B | Klassifizierung, Extraktion |
| Stufe 2 | $$ — gpt-4o-mini | Standard-Agentenschritte |
| Stufe 3 | $$$ — gpt-4o / claude | Schwierige Schlussfolgerungen, abschließende Synthese |
Nettoeinsparungen messen
Erfassen Sie:
- Den prozentualen Anteil der Anfragen, die von jeder Stufe bearbeitet werden
- Die Qualität, also die Bestehensquote in Evaluierungen, pro Stufe
- Die Gesamtkosten pro Anfrage
Vergleichen Sie die Ergebnisse mit einer Baseline, bei der immer das große Modell verwendet wird, um zu prüfen, ob das Routing tatsächlich hilft.
Konfidenz kalibrieren
Die vom Modell selbst angegebene Konfidenz ist unzuverlässig. Kalibrieren Sie sie anhand eines Evaluierungsdatensatzes. Wenn das Modell 90 % angibt, aber nur in 60 % der Fälle richtig liegt, passen Sie Ihren Schwellenwert an.
Open-Source-Router
RouteLLM (LMSYS) ist ein OSS-Framework für trainierte Modell-Router. Es lohnt sich, das Framework zu untersuchen, wenn Routing für Ihre Kostenstruktur entscheidend ist.
Routing-Strategie
Welche Routing-Strategie ist die einfachste und effektivste?
Zusammenfassung
Modelle in Stufen, zuerst das günstige Modell mit Eskalation, Routing pro Schritt und Fallback-Ketten. Messen Sie die Verteilung auf die Stufen und die Qualität. Routing ist der wichtigste Hebel für Produktionskosten.
Häufig gestellte Fragen
Ist die Lektion „Modell-Routing (günstig -> teuer)“ kostenlos?
Ja — der vollständige Text von „Modell-Routing (günstig -> teuer)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Modell-Routing (günstig -> teuer)“?
Versuchen Sie es zuerst mit einem kleinen Modell und wechseln Sie nur dann zu einem Frontier-Modell, wenn das kleine Modell scheitert oder eine geringe Konfidenz hat. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Modell-Routing (günstig -> teuer)“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Token-Budgets pro Schritt
- Modell-Routing (günstig -> teuer)
- Caching von Prompts und Ergebnissen (Anthropic, Vertex)
- Quantisierung und spekulatives Decoding