AI Agents · Lekcja

Kompromisy: opóźnienie, koszt, możliwości

Otwarte wagi obniżają koszty, ale wymagają czasu inżynierów; wykonaj testy porównawcze przed podjęciem decyzji.

Lekcja 4 z 414 kroki

Kompromisy: opóźnienie, koszt, możliwości to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.

Trzy wymiary, należy wybrać dwa

Każdy wybór modelu wiąże się z kompromisem między:

  • Opóźnieniem — czasem potrzebnym na odpowiedź
  • Kosztem — kosztem miliona tokenów
  • Możliwościami — jakością w trudnych zadaniach

Żaden model nie jest najlepszy we wszystkich trzech aspektach.

Mapa możliwości

Najwyższa klasaŚrednia klasaMałe modele
ZamknięteGPT-4o, Claude Sonnet 4.5GPT-4o-mini, Haiku—
OtwarteLlama 3.1 405BLlama 3.1 70B, Qwen 2.5 72BLlama 3.1 8B, Phi-3

Mapa opóźnień

Przybliżone opóźnienie p50 podczas typowej tury agenta:

  • Groq Llama 3.1 70B: ~200 ms (błyskawicznie)
  • gpt-4o-mini: ~600 ms
  • gpt-4o: ~1500 ms
  • Samodzielnie hostowany Llama 70B na 1xH100: ~800 ms
  • Samodzielnie hostowany Llama 8B na RTX 4090: ~200 ms

Koszt miliona tokenów (orientacyjny)

Orientacyjne ceny z połowy 2025 r., wejście/wyjście:

  • GPT-4o: $2.50 / $10
  • GPT-4o-mini: $0.15 / $0.60
  • Claude Sonnet 4.5: $3 / $15
  • Claude Haiku: $0.80 / $4
  • Together Llama 70B: $0.88 / $0.88
  • Groq Llama 70B: $0.59 / $0.79
  • Hostowane samodzielnie (własne GPU): zasadniczo bezpłatnie za token

Oblicz punkt opłacalności

Samodzielne hostowanie oszczędza pieniądze dopiero powyżej określonego progu wolumenu. Przybliżony szacunek:

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

Routing modeli

Należy domyślnie używać tanich modeli, a do droższych przechodzić tylko w razie potrzeby:

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

Routing na poszczególnych etapach

Wewnątrz agenta należy kierować zapytania na poszczególnych etapach:

  • Planowanie za pomocą GPT-4o (złożone wnioskowanie)
  • Wyszukiwanie za pomocą Llama 8B (tanie pętle)
  • Synteza za pomocą Claude (wysoka jakość tekstu)

Ścieżki wrażliwe na opóźnienia

W przypadku głosu i czatu w czasie rzeczywistym:

  • Należy używać Groq, SambaNova lub Cerebras, aby uzyskać opóźnienie poniżej 200 ms
  • Należy intensywnie strumieniować tokeny
  • Należy unikać wieloetapowych agentów na ścieżce krytycznej

Ścieżki wrażliwe na jakość

W przypadku odpowiedzi końcowych i pracy o wysokiej stawce:

  • Należy używać najlepszego modelu, na jaki można sobie pozwolić
  • Należy dodać krytykę między modelami (GPT-4 pisze, Claude sprawdza)
  • Należy dodać weryfikację (uruchamiać kod, sprawdzać fakty)

Całkowity koszt posiadania

Na koszt samodzielnego hostowania składają się:

  • Wynajem GPU lub nakłady inwestycyjne
  • Czas pracy inżynierów na zarządzanie infrastrukturą
  • Monitorowanie i dyżury on-call
  • Mniejsza przepustowość niż w usługach hostowanych

Dla większości zespołów hostowane interfejsy API mają niższy całkowity koszt posiadania aż do bardzo dużego wolumenu.

Kiedy warto płacić za duże zamknięte modele

  • Końcowe odpowiedzi dla użytkowników
  • Wnioskowanie z wykorzystaniem czołowych modeli
  • Multimodalność
  • Kontekst 200 tys. tokenów i większy

Testuj na własnym zadaniu

Publiczne benchmarki pokazują tylko część obrazu. Należy zbudować zestaw ewaluacyjny zawierający 50 pytań na rzeczywistych danych i zmierzyć na nim każdy rozważany model. Należy wybrać najtańszy model spełniający wymagania jakościowe.

Strategia routingu

Jaka strategia routingu modeli jest najtańsza, a jednocześnie zapewnia wymaganą jakość?

Podsumowanie

Opóźnienie, koszt, możliwości — można wybrać tylko dwa. Należy domyślnie używać tanich modeli, a w razie potrzeby przechodzić do droższych. Hostowane interfejsy API otwartych modeli (Groq, Together) często przewyższają oba rozwiązania skrajne.

Bezpłatny start

Ucz się AI Agents dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
60
Lekcje
239

Często zadawane pytania

Czy lekcja „Kompromisy: opóźnienie, koszt, możliwości” jest bezpłatna?

Tak — pełny tekst „Kompromisy: opóźnienie, koszt, możliwości” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.

Co nauczysz się w „Kompromisy: opóźnienie, koszt, możliwości”?

Otwarte wagi obniżają koszty, ale wymagają czasu inżynierów; wykonaj testy porównawcze przed podjęciem decyzji. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Agents?

Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Kompromisy: opóźnienie, koszt, możliwości”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?

Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Przegląd modeli Llama, Mistral i Qwen
  2. Uruchamianie modeli lokalnych za pomocą Ollama i llama.cpp
  3. Wywoływanie funkcji w modelach otwartych (Hermes, Functionary)
  4. Kompromisy: opóźnienie, koszt, możliwości
← Powrót do AI Agents