0Pricing
AI Agents · Ders

Altın Sınama Kümesi Oluşturma

Gerçek kullanımın uzun kuyruğunu kapsayan 50-200 yüksek kaliteli (girdi, beklenen çıktı) çifti derleyin.

Altın Sınama Kümesi Oluşturma, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 2. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.

Altın Küme Nedir

"Altın sınama kümesi" (veya "altın küme"), iyi davranışın nasıl olması gerektiğini tanımlayan, seçilerek oluşturulmuş (giriş, beklenen çıktı) çiftlerinden oluşan bir koleksiyondur.

Her değişiklik bu kümeye göre ölçülür.

İyi Bir Altın Kümenin Özellikleri

  • Çeşitli — yaygın AND uç durumları kapsar
  • İnsanlar tarafından seçilmiş — otomatik olarak oluşturulmamış
  • Sürümlenmiş — deponuzda sabitlenmiş
  • Belgelenmiş — her örneğin bir gerekçesi vardır

Kaç Örnek Gerekir

Genel kural:

  • 50 örnek — kullanılabilir en düşük düzey
  • 200 örnek — iyi kapsam
  • 1000+ örnek — olgun ürün

Kalite > nicelik. İyi seçilmiş 50 örnek, rastgele 500 örnekten daha değerlidir.

Örnekleri Nereden Toplamalı

  1. Kullanıcı görüşmeleri — gerçek kullanıcıların sordukları
  2. Üretim günlükleri — gelen sorular
  3. Hata raporları — her hata bir değerlendirmeye dönüşür
  4. Karşıt örnek üretimi — LLM'den aracıyı bozmasını isteyin

Mining Bad Production Traces

for trace in last_week_traces():
    if trace.has_thumbs_down or trace.had_error:
        case = {
            'input': trace.input,
            'why_bad': trace.feedback_comment,
            'expected': None   # to be filled by human reviewer
        }
        save_to_review_queue(case)

Beklenen Çıktı: Birebir Eşleşme mi, Sezgisel Ölçüt mü

Beklenen çıktının iki türü vardır:

  • Birebir eşleşme — çıkarma, sınıflandırma ve hesaplama için
  • Sezgisel ölçüt — açık uçlu soru-cevap için; temel gerçeklerin görünüp görünmediğini puanlayın

Heuristic Scoring

def score_answer(actual, expected_facts):
    return sum(1 for f in expected_facts if f.lower() in actual.lower()) / len(expected_facts)

case = {
    'input': 'What is our refund policy?',
    'expected_facts': ['30 days', 'unopened', 'receipt required'],
    'min_score': 0.66   # at least 2 of 3 facts mentioned
}

actual_answer = "You can return items within 30 days if they are unopened."
score = score_answer(actual_answer, case['expected_facts'])
print(f"Score: {score:.2f} (min required: {case['min_score']})")

Karşıt Örnekler

Zor örnekleri dahil edin:

  • Kapsam dışı sorular ("Mars'ta hava nasıl?")
  • Belirsiz sorgular
  • İstem enjeksiyonu girişimleri
  • Yabancı dilde girişler
  • Çok uzun girişler

Altın Kümeyi Sürümleme

Deponuzda JSON olarak saklayın. Kümeyi güncelleyen her PR nedenini açıklamalıdır:

// gold-set.json
[
  {
    "id": "refund-policy-001",
    "input": "What is your refund policy?",
    "expected_facts": ["30 days", "unopened", "receipt required"],
    "added_by": "alice@",
    "added_at": "2025-08-12",
    "reason": "Top customer support question"
  }
]

Sınama/Tutulan Küme Bölümleri

Aşırı uyumu tespit etmek için kümeyi şöyle ayırın:

  • Geliştirme kümesi — üzerinde yineleyin (bunu görürsünüz)
  • Sınama kümesi — üzerinde ölçün (buna göre ayarlama yapmayın — NOT)
  • Tutulan küme — yalnızca büyük sürümlerden önce kullanılır

Pareto Etiketleme

Gerilediğiniz yeri WHERE görebilmek için örnekleri kategoriye göre etiketleyin:

tag1 = {'tags': ['policy', 'common-question']}
tag2 = {'tags': ['math', 'edge-case']}
print(tag1)
print(tag2)

# Run eval and report:
print("Category 'policy': 0.92")
print("Category 'math': 0.68   <- regression here")

Değerlendirme Ölçütleri

Karmaşık çıktılar için bir değerlendirme yönergesi yazın: neyin bulunması, neyin NOT bulunması ve neyin tercih edilmesi gerektiğini belirtin:

rubric = {
    'must_include': ['30 days'],
    'must_not_include': ['no refunds'],
    'preferably_includes': ['receipt']
}
for k, v in rubric.items():
    print(f"{k}: {v}")

Örnekler İçin Kaynak

Değerlendirme örnekleri için en güçlü kaynak nedir?

Özet

Gerçek kullanıcılardan ve üretim hatalarından elde edilen 50'den fazla seçilmiş örnek. Sürümünü yönetin; etiketleyin; geliştirme/sınama/tutulan kümelere ayırın. Her hatayla birlikte büyütün.

Sıkça Sorulan Sorular

“Altın Sınama Kümesi Oluşturma” dersi ücretsiz mi?

Evet — “Altın Sınama Kümesi Oluşturma” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“Altın Sınama Kümesi Oluşturma” dersinde ne öğreneceğim?

Gerçek kullanımın uzun kuyruğunu kapsayan 50-200 yüksek kaliteli (girdi, beklenen çıktı) çifti derleyin. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 2. dersidir.

“Altın Sınama Kümesi Oluşturma” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Aracılar için Değerlendirme Odaklı Geliştirme
  2. Altın Sınama Kümesi Oluşturma
  3. LLM'yi Hakem Olarak Kullanmanın Tuzakları
  4. Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench
← AI Agents Sayfasına Dön