Aracılar için Değerlendirme Odaklı Geliştirme
Aracıyı yayınlamadan önce değerlendirmeyi yazın; gerilemeler olmadan yinelemenin tek yolu budur.
Aracılar için Değerlendirme Odaklı Geliştirme, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.
Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.
Değerlendirmeler Yapay Zekâ İçin Sınamalardır
Kodunuzu sınamalar olmadan yayımlamazsınız. Aynı mantık LLM aracıları için de geçerlidir — değerlendirmeler olmadan her değişiklik yazı tura atmak gibidir.
Değerlendirme Odaklı Geliştirme (EDD), değişikliği kullanıma sunmadan BEFORE değerlendirmeyi yazmak anlamına gelir.
EDD Döngüsü
- Başarısız olan bir değerlendirme yazın: giriş + beklenen davranış
- Değerlendirme başarılı olana kadar aracıyı iyileştirin
- Değerlendirmeyi paketine ekleyin
- Her değişiklikte çalıştırın
Neyi Değerlendirmelisiniz
Bir aracı için birden fazla düzeyde değerlendirme yapın:
- Bileşen — getirici doğru parçaları döndürüyor mu?
- Adım — LLM doğru aracı seçiyor mu?
- Uçtan uca — aracı doğru nihai yanıtı üretiyor mu?
Değerlendirme Verileri
Her değerlendirme satırı en azından şunlardan oluşur:
eval_example = {
'input': 'What is our return policy?',
'expected_output': 'mentions 30-day window',
'expected_tool_calls': ['retrieve'],
'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
print(f"{k}: {v}")
Run an Eval Suite
def run_evals(suite, agent):
results = []
for case in suite:
actual = agent.run(case['input'])
scores = [
score_correctness(actual, case['expected_output']),
score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
]
results.append({'case': case, 'actual': actual, 'scores': scores})
return resultsCI Entegrasyonu
Değerlendirmeleri her PR'da çalıştırın. Kalite eşik değerinin altına düşerse birleştirmeyi engelleyin:
# .github/workflows/evals.yml
on: pull_request
jobs:
evals:
runs-on: ubuntu-latest
steps:
- run: python -m evals.run --fail-below 0.85Değerlendirme Sıklığı
- Bileşen değerlendirmeleri — her PR'da
- Uçtan uca değerlendirmeler — her PR'da (örneklemeli) + her gece (tam)
- Üretim izleri -> değerlendirme kümesi — haftalık
Üretim -> Değerlendirme Hattı
Gerçek izlerden veri çıkarın. Kötü sonuçlar yarının değerlendirmelerine dönüşür:
for trace in production_traces_with_thumbs_down():
add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)LangSmith / Langfuse Değerlendirmesi
Her iki araçta da yerleşik değerlendirme desteği bulunur: veri kümesi sürümleme, değerlendirme işlevleri, karşılaştırma görünümleri.
Manuel Örnek Kontrolleri
Otomatik değerlendirmeler üslubu ve incelikleri kaçırır. Düzenli aralıklarla rastgele 20 izi elle okuyun — değerlendirmelerin kaçırdığı sorunları yakalar.
Karşıt Kalıp: Değerlendirme Kümesini Ezberleme
Aracıyı değerlendirmenizi geçene kadar ayarlarsanız ancak değerlendirme küçükse aşırı uyum sağlarsınız. Değerlendirmeleri sürekli genişletin ve sınama/eğitim bölümlerini dönüşümlü kullanın.
Değerlendirme Kümesinin Bakımı
Ürününüz değiştikçe değerlendirmeler de geçerliliğini yitirir. Yeni özellikler için örnekler ekleyin; kaldırılan özelliklere ait örnekleri kullanımdan çıkarın.
EDD Tanımı
Değerlendirme Odaklı Geliştirme ne anlama gelir?
Özet
Değerlendirme Odaklı Geliştirme, ciddi aracı sistemler için vazgeçilmezdir. Her düzeyde değerlendirmeler yazın, bunları CI'da çalıştırın ve paketinizi üretim izlerinden büyütün.
Sıkça Sorulan Sorular
“Aracılar için Değerlendirme Odaklı Geliştirme” dersi ücretsiz mi?
Evet — “Aracılar için Değerlendirme Odaklı Geliştirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.
“Aracılar için Değerlendirme Odaklı Geliştirme” dersinde ne öğreneceğim?
Aracıyı yayınlamadan önce değerlendirmeyi yazın; gerilemeler olmadan yinelemenin tek yolu budur. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Agents öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.
“Aracılar için Değerlendirme Odaklı Geliştirme” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Aracılar için Değerlendirme Odaklı Geliştirme
- Altın Sınama Kümesi Oluşturma
- LLM'yi Hakem Olarak Kullanmanın Tuzakları
- Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench