Routing modeli (tani -> drogi)
Najpierw wypróbuj mały model, a do modelu frontier przejdź tylko wtedy, gdy mały model zawiedzie lub będzie mieć niski poziom pewności.
Routing modeli (tani -> drogi) to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
Nie używaj dużych modeli do łatwych zadań
Wywoływanie GPT-4o w celu ustalenia, „czy ten e-mail to spam?”, jest marnowaniem pieniędzy. Łatwe zadania należy kierować do tanich modeli, a trudne — do drogich.
Schemat routingu
- Najpierw spróbuj użyć małego, taniego modelu
- Jeśli wynik ma niską wiarygodność lub nie przejdzie walidacji, przekaż zadanie większemu modelowi
- Zapisuj, która ścieżka została wybrana
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Routing na podstawie walidacji
Jeśli wynik taniego modelu nie przejdzie walidacji schematu, przekaż zadanie większemu modelowi:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Wybór modelu dla poszczególnych kroków
Różne części agenta wymagają różnych modeli:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Routing między dostawcami
Proszę używać Groq ze względu na opóźnienia, OpenAI ze względu na jakość, a Anthropic ze względu na długi kontekst:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM jako router
Mały model klasyfikuje żądanie i wybiera kolejny model:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Łańcuch zastępczy
Jeśli główny model zawiedzie, na przykład z powodu limitu zapytań lub błędu, proszę spróbować użyć modelu pomocniczego:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Routing na podstawie embeddingów
Proszę wygenerować embedding zapytania. Jeśli jest podobny do znanego łatwego przypadku, należy użyć taniego modelu; w przeciwnym razie — dużego:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Przykład hierarchii routingu
| Poziom | Koszt | Zastosowanie |
|---|---|---|
| Poziom 1 | $ — Llama 8B | Klasyfikacja, ekstrakcja |
| Poziom 2 | $$ — gpt-4o-mini | Standardowe kroki agenta |
| Poziom 3 | $$$ — gpt-4o / claude | Trudne rozumowanie, końcowa synteza |
Mierzenie rzeczywistych oszczędności
Proszę śledzić:
- Odsetek żądań obsłużonych przez każdy poziom
- Jakość, czyli odsetek zaliczonych testów, dla każdego poziomu
- Łączny koszt pojedynczego żądania
Proszę porównać wyniki z punktem odniesienia, w którym zawsze używany jest duży model, aby sprawdzić, czy routing rzeczywiście pomaga.
Kalibracja pewności
Pewność deklarowana przez model jest niewiarygodna. Proszę przeprowadzić kalibrację na zbiorze ewaluacyjnym. Jeśli model deklaruje 90% pewności, ale poprawnie odpowiada tylko w 60% przypadków, należy skorygować próg.
Routery open source
RouteLLM (LMSYS) to framework open source do trenowania routerów modeli. Warto się nim zainteresować, jeśli routing ma kluczowe znaczenie dla struktury kosztów.
Strategia routingu
Jaka jest najprostsza i najskuteczniejsza strategia routingu?
Podsumowanie
Modele warstwowe, rozpoczynanie od taniego modelu i eskalacja, routing dla poszczególnych kroków oraz łańcuchy zastępcze. Należy mierzyć udział poszczególnych poziomów i jakość. Routing jest najskuteczniejszym narzędziem ograniczania kosztów produkcyjnych.
Często zadawane pytania
Czy lekcja „Routing modeli (tani -> drogi)” jest bezpłatna?
Tak — pełny tekst „Routing modeli (tani -> drogi)” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Routing modeli (tani -> drogi)”?
Najpierw wypróbuj mały model, a do modelu frontier przejdź tylko wtedy, gdy mały model zawiedzie lub będzie mieć niski poziom pewności. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Routing modeli (tani -> drogi)”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Budżety tokenów na krok
- Routing modeli (tani -> drogi)
- Buforowanie promptów i wyników (Anthropic, Vertex)
- Kwantyzacja i dekodowanie spekulatywne