AI Prompt Engineering · Ders

Kararı Değerlendirme

Kaliteyi ve maliyeti ölçme.

4. ders / 413 adım

Kararı Değerlendirme, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.

Ölçemediğiniz Şeye Karar Veremezsiniz

İstem, ince ayar veya hibrit arasındaki seçim, arkasındaki değerlendirme kadar iyidir. Dondurulmuş bir değerlendirme kümesi ve maliyet modeli olmadan her karşılaştırma kişisel gözlemden ibarettir.

  • Kalite ve maliyet iki eksendir; onları erkenden tek sayıya indirgemeyin
  • Değerlendirme kümesi, karşılaştırdığınız her yaklaşımda dışarıda tutulmalı ve sabit kalmalıdır
  • Kazanan, kısıtlarınıza göre kalite-maliyet sınırındaki en iyi noktayı sunan yaklaşımdır

Önce Dondurulmuş Değerlendirme Kümesini Oluşturun

Herhangi bir şeyi karşılaştırmadan önce, hiçbir yaklaşımın eğitiminde kullanmadığı ayrılmış bir değerlendirme kümesi oluşturun. Bu küme gerçek dağılımı kapsamalıdır: yaygın durumlar, bilinen uç durumlar ve yaklaşık üretim oranlarındaki saldırgan girdiler.

Kümeyi dondurun. Yalnızca istem kullanan, ince ayarlı ve hibrit yaklaşımların her biri aynı kümede puanlanmalıdır. Değerlendirme karşılaştırmalar arasında değişirse sayılar karşılaştırılabilir olmaz ve karar geçersiz hâle gelir.

def split_eval(labeled, holdout_ratio=0.2, seed=42):
    import random
    rng = random.Random(seed)        # fixed seed = reproducible split
    data = labeled[:]
    rng.shuffle(data)
    cut = int(len(data) * (1 - holdout_ratio))
    train, frozen_eval = data[:cut], data[cut:]
    return train, frozen_eval        # eval never enters any training run

Göreve Uygun Ölçütleri Seçin

Genel doğruluk, göreve özgü hataları gizler. Gerçekte önemli olanı yakalayan ölçütleri seçin:

  • Yapılandırılmış çıktı için tam eşleşme/şema eşleşmesi
  • İnsanların denetlediği bir örneklemle birlikte açık uçlu kalite için ölçütle puanlanan LLM değerlendiricisi
  • Kuyruk ölçütleri — yalnızca mean değil, en kötü durum ve p95
  • Kaliteden ayrı olarak puanlanan kesin eşikler şeklinde güvenlik/reddetme oranları

Felaket düzeyindeki kuyruğu gizleyen bir mean puanı sizi yanlış karara götürür.

Her Adayı Aynı Şekilde Puanlayın

Yalnızca istem kullanan, ince ayarlı ve hibrit yaklaşımları aynı dondurulmuş kümede aynı puanlayıcıdan geçirerek çalıştırın. Karşılaştırmaların eşit koşullarda yapılması için her biri adına kaliteyi ve tam maliyet vektörünü kaydedin.

def evaluate(candidate, frozen_eval, scorer):
    results = []
    for ex in frozen_eval:
        out = candidate.run(ex['input'])
        results.append(scorer(out, ex['label']))
    mean = sum(results) / len(results)
    p95 = sorted(results)[int(0.95 * len(results)) - 1]
    return {'mean': mean, 'p95_worst': p95}

# Identical frozen_eval + scorer for prompt / tuned / hybrid

Tam Maliyet Vektörünü Modelleyin

Maliyet tek bir sayı değildir. Karşılaştırmanın kullandığınız hacimdeki gerçeği yansıtması için her bileşeni kaydedin:

  • Çağrı başına çıkarım: giriş ve çıkış belirteçlerinin fiyatla çarpımı (uzun istemler çağrı başına daha pahalıdır)
  • Paylaştırılmış eğitim: ince ayar maliyetinin beklenen istek hacmine yayılması
  • Bakım: veri pipeline'ı, değerlendirme çalıştırmaları ve temel model değişikliklerinde yeniden ince ayar
  • Gecikme: dönüşüm oranını veya kullanıcı deneyimini etkilediğinde ayrı fiyatlandırılır
def monthly_cost(calls, in_tok, out_tok, price_in, price_out,
                 train_cost=0.0, months_amortized=12):
    inference = calls * ((in_tok/1000)*price_in + (out_tok/1000)*price_out)
    amortized_train = train_cost / months_amortized
    return inference + amortized_train

# Long prompt-only: high in_tok, train_cost=0
# Tuned: low in_tok, train_cost>0 amortized over volume

Kalite-Maliyet Sınırını Çizin

Her aday için kaliteyi ve aylık maliyeti belirledikten sonra onları bir sınıra yerleştirin. Başka bir aday hem daha yüksek kaliteye hem de daha düşük maliyete sahipse bir aday baskılanmış sayılır; baskılananları eleyin.

non_dominated kümesi içinde doğru seçim kısıtınıza bağlıdır: kalite eşiğini geçen en ucuz seçeneği veya maliyet tavanı içindeki en yüksek kaliteyi seçin. Karar artık bir tercih meselesi değil, açık ve savunulabilir bir karardır.

def non_dominated(candidates):
    # candidate: {'name','quality','cost'} -- higher quality, lower cost better
    keep = []
    for c in candidates:
        dominated = any(o['quality'] >= c['quality'] and o['cost'] <= c['cost']
                        and o != c for o in candidates)
        if not dominated:
            keep.append(c)
    return keep

İstatistiksel Anlamlılık, Gürültü Değil

200 örnekli bir değerlendirmede iki puanlık artış gürültü olabilir. Kazananı ilan etmeden önce kalite farkının, değerlendirme kümenizin boyutu göz önüne alındığında istatistiksel olarak anlamlı olup olmadığını kontrol edin.

Eşleştirilmiş bir karşılaştırma kullanın (aynı örnekleri her iki adaydan geçirin) ve fark için bir güven aralığı hesaplayın. Aralık sıfırı kapsıyorsa gerçek bir iyileşme elde etmiş değilsiniz; bu durumda ince ayarın ek maliyeti haklı çıkarılamaz.

def paired_diff_ci(scores_a, scores_b):
    import statistics
    diffs = [a - b for a, b in zip(scores_a, scores_b)]
    mean = statistics.mean(diffs)
    sd = statistics.pstdev(diffs)
    se = sd / (len(diffs) ** 0.5)
    return (mean - 1.96*se, mean + 1.96*se)  # if it spans 0 -> not significant

Değerlendirme Sızıntısına Karşı Korunun

İnce ayarın olduğundan daha iyi görünmesini sağlamanın en hızlı yolu sızıntıdır: değerlendirme kümesiyle örtüşen eğitim örnekleri. Sızıntılı bir değerlendirme ezberlemeyi ödüllendirir ve ince ayarlı adayın puanını şişirir.

Eğitim/değerlendirme sınırı boyunca yinelenenleri kaldırın, neredeyse yinelenenleri kontrol edin ve zaman bakımından ayrılmış bir değerlendirmeyi (tarihe göre dışarıda tutulmuş) tercih edin; böylece ince ayarlı model onu görmemiş olur. Sızıntı, üretimde başarısız olan bir ince ayar kararının en yaygın tek nedenidir.

Kullanıma Sunduğunuzda İzlemeye Devam Edin

Karar, kullanıma sunma sırasında kesinleşmez. Üretim dağılımı zamanla kayar ve girdiler eğitim dağılımından uzaklaştıkça ince ayarlı bir model fark edilmeden kötüleşebilir.

  • Canlı trafikten örnekler alın ve aynı değerlendirme ölçütüne göre puanlayın
  • Kalite düşüşleri ve çağrı başına maliyet artışı için uyarı oluşturun
  • Temel model sürümü her değiştiğinde dondurulmuş değerlendirmeyi yeniden çalıştırın

Seçtiğiniz yaklaşımı sonuçlanmış bir karar olarak değil, sürekli test edilen bir hipotez olarak ele alın.

Karar Kaydı

Karşılaştırmayı yazılı bir karar kaydı olarak belgeleyin: dondurulmuş değerlendirme kümesini, her adayın kalite ve maliyet vektörünü, anlamlılık sonucunu, varsayılan hacmi ve gerekçesiyle birlikte sınırda seçilen noktayı kaydedin.

Bu, seçimi denetlenebilir ve yeniden değerlendirilebilir hâle getirir. Hacim veya temel model değiştiğinde kaydı yeniden açıp tekrar çalıştırırsınız; belleğe dayanarak konuyu yeniden tartışmanız gerekmez.

Uçtan Uca Karar İşlevi

Her şeyi bir araya getirin: her adayı dondurulmuş değerlendirmede puanlayın, maliyetini ekleyin, baskılanan seçenekleri eleyin, en ucuz temel yaklaşıma kıyasla anlamlılık koşulu koyun, ardından bağlayıcı kısıtınıza göre seçim yapın.

def decide(candidates, quality_bar, cost_ceiling):
    frontier = non_dominated(candidates)
    feasible = [c for c in frontier
                if c['quality'] >= quality_bar and c['cost'] <= cost_ceiling]
    if not feasible:
        return 'NO_CANDIDATE_MEETS_CONSTRAINTS'
    # cheapest option that clears the quality bar
    return min(feasible, key=lambda c: c['cost'])['name']

# Prefer prompt-only on ties: lower maintenance TCO

Kısa Kontrol

İnce ayarlı bir model, 150 örnekli bir değerlendirmede istem kullanımından 2 puan daha yüksek sonuç alıyor, ancak fark için eşleştirilmiş güven aralığı sıfırı kapsıyor. Ayrıca aylık maliyeti de daha yüksek. Doğru karar nedir?

Özet

Sezgilere değil, dondurulmuş bir değerlendirmeye ve dürüst bir maliyet vektörüne göre karar verin. Kalite ve maliyet iki eksendir; yanıt, bağlayıcı kısıtınıza göre seçilen kalite-maliyet sınırındaki bir noktadır.

  • Tek bir değerlendirme kümesini dondurun; her adayı bu kümede aynı şekilde puanlayın
  • Göreve uygun ölçütleri seçin ve yalnızca mean değerini değil, kuyruğu da izleyin
  • Tam maliyet vektörünü modelleyin ve eğitimi gerçek hacme göre paylaştırın
  • İstatistiksel anlamlılık koşulu arayın; sıfırı kapsayan bir güven aralığı iyileşme olmadığını gösterir
  • Değerlendirme sızıntısına karşı korunun — yanlış ince ayar kazanımlarının başlıca nedeni budur
  • Kullanıma sunma sonrasında izleyin ve yeniden çalıştırılabilmesi için kararı kaydedin
Başlamak ücretsiz

Yapay zeka eğitmeniyle AI Prompt Engineering öğren — ücretsiz

Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.

Kurslar
53
Dersler
199

Sıkça Sorulan Sorular

“Kararı Değerlendirme” dersi ücretsiz mi?

Evet — “Kararı Değerlendirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.

“Kararı Değerlendirme” dersinde ne öğreneceğim?

Kaliteyi ve maliyeti ölçme. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.

“Kararı Değerlendirme” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. İstem Yazmanın Yeterli Olduğu Durumlar
  2. İnce Ayar Ne Zaman Yapılmalı
  3. Hibrit: İstem ve Hafif Ayar
  4. Kararı Değerlendirme
← AI Prompt Engineering Sayfasına Dön