0Pricing
AI Agents · Ders

Aracılar için Değerlendirme Odaklı Geliştirme

Aracıyı yayınlamadan önce değerlendirmeyi yazın; gerilemeler olmadan yinelemenin tek yolu budur.

Aracılar için Değerlendirme Odaklı Geliştirme, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.

Değerlendirmeler Yapay Zekâ İçin Sınamalardır

Kodunuzu sınamalar olmadan yayımlamazsınız. Aynı mantık LLM aracıları için de geçerlidir — değerlendirmeler olmadan her değişiklik yazı tura atmak gibidir.

Değerlendirme Odaklı Geliştirme (EDD), değişikliği kullanıma sunmadan BEFORE değerlendirmeyi yazmak anlamına gelir.

EDD Döngüsü

  1. Başarısız olan bir değerlendirme yazın: giriş + beklenen davranış
  2. Değerlendirme başarılı olana kadar aracıyı iyileştirin
  3. Değerlendirmeyi paketine ekleyin
  4. Her değişiklikte çalıştırın

Neyi Değerlendirmelisiniz

Bir aracı için birden fazla düzeyde değerlendirme yapın:

  • Bileşen — getirici doğru parçaları döndürüyor mu?
  • Adım — LLM doğru aracı seçiyor mu?
  • Uçtan uca — aracı doğru nihai yanıtı üretiyor mu?

Değerlendirme Verileri

Her değerlendirme satırı en azından şunlardan oluşur:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

CI Entegrasyonu

Değerlendirmeleri her PR'da çalıştırın. Kalite eşik değerinin altına düşerse birleştirmeyi engelleyin:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

Değerlendirme Sıklığı

  • Bileşen değerlendirmeleri — her PR'da
  • Uçtan uca değerlendirmeler — her PR'da (örneklemeli) + her gece (tam)
  • Üretim izleri -> değerlendirme kümesi — haftalık

Üretim -> Değerlendirme Hattı

Gerçek izlerden veri çıkarın. Kötü sonuçlar yarının değerlendirmelerine dönüşür:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

LangSmith / Langfuse Değerlendirmesi

Her iki araçta da yerleşik değerlendirme desteği bulunur: veri kümesi sürümleme, değerlendirme işlevleri, karşılaştırma görünümleri.

Manuel Örnek Kontrolleri

Otomatik değerlendirmeler üslubu ve incelikleri kaçırır. Düzenli aralıklarla rastgele 20 izi elle okuyun — değerlendirmelerin kaçırdığı sorunları yakalar.

Karşıt Kalıp: Değerlendirme Kümesini Ezberleme

Aracıyı değerlendirmenizi geçene kadar ayarlarsanız ancak değerlendirme küçükse aşırı uyum sağlarsınız. Değerlendirmeleri sürekli genişletin ve sınama/eğitim bölümlerini dönüşümlü kullanın.

Değerlendirme Kümesinin Bakımı

Ürününüz değiştikçe değerlendirmeler de geçerliliğini yitirir. Yeni özellikler için örnekler ekleyin; kaldırılan özelliklere ait örnekleri kullanımdan çıkarın.

EDD Tanımı

Değerlendirme Odaklı Geliştirme ne anlama gelir?

Özet

Değerlendirme Odaklı Geliştirme, ciddi aracı sistemler için vazgeçilmezdir. Her düzeyde değerlendirmeler yazın, bunları CI'da çalıştırın ve paketinizi üretim izlerinden büyütün.

Sıkça Sorulan Sorular

“Aracılar için Değerlendirme Odaklı Geliştirme” dersi ücretsiz mi?

Evet — “Aracılar için Değerlendirme Odaklı Geliştirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“Aracılar için Değerlendirme Odaklı Geliştirme” dersinde ne öğreneceğim?

Aracıyı yayınlamadan önce değerlendirmeyi yazın; gerilemeler olmadan yinelemenin tek yolu budur. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.

“Aracılar için Değerlendirme Odaklı Geliştirme” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Aracılar için Değerlendirme Odaklı Geliştirme
  2. Altın Sınama Kümesi Oluşturma
  3. LLM'yi Hakem Olarak Kullanmanın Tuzakları
  4. Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench
← AI Agents Sayfasına Dön