Ödünleşimler: Gecikme, Maliyet, Yetenek
Açık ağırlıklar paradan tasarruf sağlar ancak mühendislik saatlerine mal olur; karar vermeden önce kıyaslama yapın.
Ödünleşimler: Gecikme, Maliyet, Yetenek, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.
Üç Eksen, İkisini Seçin
Her model seçimi şu özellikler arasında ödünleşim gerektirir:
- Gecikme — yanıt başına süre
- Maliyet — milyon belirteç başına
- Yetenek — zor görevlerdeki kalite
Hiçbir model bu üçünün tamamında en iyi değildir.
Yetenek Görünümü
| Üst düzey | Orta düzey | Küçük ölçek | |
|---|---|---|---|
| Kapalı | GPT-4o, Claude Sonnet 4.5 | GPT-4o-mini, Haiku | — |
| Açık | Llama 3.1 405B | Llama 3.1 70B, Qwen 2.5 72B | Llama 3.1 8B, Phi-3 |
Gecikme Görünümü
Tipik bir ajan turu için yaklaşık p50 gecikmesi:
- Groq Llama 3.1 70B: ~200 ms (son derece hızlı)
- gpt-4o-mini: ~600 ms
- gpt-4o: ~1500 ms
- 1xH100 üzerinde kendi sunucunuzda barındırılan Llama 70B: ~800 ms
- RTX 4090 üzerinde kendi sunucunuzda barındırılan Llama 8B: ~200 ms
Milyon Belirteç Başına Maliyet (Yaklaşık)
2025 ortası yaklaşık değerleri, giriş/çıkış:
- GPT-4o: $2.50 / $10
- GPT-4o-mini: $0.15 / $0.60
- Claude Sonnet 4.5: $3 / $15
- Claude Haiku: $0.80 / $4
- Together Llama 70B: $0.88 / $0.88
- Groq Llama 70B: $0.59 / $0.79
- Kendi sunucunuzda barındırma (GPU'nuz): belirteç başına pratikte ücretsiz
Başabaş Noktanızı Hesaplayın
Kendi sunucunuzda barındırma yalnızca belirli bir hacim eşiğinin üzerinde tasarruf sağlar. Yaklaşık hesap:
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
Model Yönlendirme
Varsayılan olarak ucuz modelleri kullanın, yalnızca gerektiğinde pahalı modellere geçin:
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)Adım Bazında Yönlendirme
Bir aracının içinde her adım için yönlendirme yapın:
- Planlamayı GPT-4o ile yapın (zorlayıcı akıl yürütme)
- Aramayı Llama 8B ile yapın (ucuz döngüler)
- Sentezi Claude ile yapın (yazım kalitesi)
Gecikmeye Duyarlı Yollar
Sesli / gerçek zamanlı sohbet için:
- 200 ms'nin altında gecikme için Groq, SambaNova veya Cerebras kullanın
- Belirteçleri mümkün olduğunca hızlı akış halinde gönderin
- Kritik yol üzerinde çok adımlı aracılardan kaçının
Kaliteye Duyarlı Yollar
Nihai yanıtlar ve kritik işler için:
- Karşılayabildiğiniz en iyi modeli kullanın
- Modeller arası eleştiri ekleyin (GPT-4 yazar, Claude inceler)
- Doğrulama ekleyin (kodu çalıştırın, gerçekleri kontrol edin)
Toplam Sahip Olma Maliyeti
Kendi sunucunuzda barındırmanın maliyetine şunlar dahildir:
- GPU kiralama veya sermaye harcaması
- Altyapıyı yönetmek için mühendis zamanı
- İzleme ve nöbetçi destek
- Barındırılan hizmetlere göre daha düşük işlem hacmi
Çoğu ekip için barındırılan API'ler, hacim çok yükselene kadar daha düşük TCO sağlar.
Büyük Kapalı Modeller İçin Ne Zaman Ödeme Yapmalısınız
- Son kullanıcıya sunulan nihai yanıtlar
- Öncü düzeyde akıl yürütme
- Çok kipli işlemler
- 200k+ bağlam
Görevinizde Kıyaslama Yapın
Herkese açık kıyaslamalar hikâyenin yalnızca bir bölümünü anlatır. Gerçek verileriniz üzerinde 50 soruluk bir değerlendirme kümesi oluşturun ve her aday modeli bununla ölçün. Kaliteyi karşılayan en ucuz modeli seçin.
Yönlendirme Stratejisi
Kaliteyi hâlâ karşılayan en ucuz model yönlendirme stratejisi nedir?
Özet
Gecikme, maliyet, yetenek — ikisini seçin. Varsayılan olarak ucuz modelleri kullanın, gerektiğinde daha üst modellere geçin. Barındırılan açık model API'leri (Groq, Together) çoğu zaman iki uç seçeneğe de üstün gelir.
Yapay zeka eğitmeniyle AI Agents öğren — ücretsiz
Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.
- Kurslar
- 60
- Dersler
- 239
Sıkça Sorulan Sorular
“Ödünleşimler: Gecikme, Maliyet, Yetenek” dersi ücretsiz mi?
Evet — “Ödünleşimler: Gecikme, Maliyet, Yetenek” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.
“Ödünleşimler: Gecikme, Maliyet, Yetenek” dersinde ne öğreneceğim?
Açık ağırlıklar paradan tasarruf sağlar ancak mühendislik saatlerine mal olur; karar vermeden önce kıyaslama yapın. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Agents öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.
“Ödünleşimler: Gecikme, Maliyet, Yetenek” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Llama, Mistral ve Qwen'e Genel Bakış
- Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma
- Açık Modellerde İşlev Çağırma (Hermes, Functionary)
- Ödünleşimler: Gecikme, Maliyet, Yetenek