0Pricing
AI Agents · Ders

Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme

Değerlendirme kümenizde temel modele karşı A/B karşılaştırması yapın — bazen ince ayar faydadan çok zarar verir.

Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.

Eğitim Kaybına Güvenmeyin

Düşük eğitim kaybı, üretimde daha iyi sonuç anlamına gelmez. Model aşırı öğrenebilir, genel yeteneğini kaybedebilir veya daha önce görülmemiş görevleri kötüleştirebilir.

Ayarlanmış modeli her zaman eğitimden ayrılmış bir değerlendirme kümesi üzerinde değerlendirin.

Olmazsa Olmaz Üç Değerlendirme Bölümü

  1. Eğitim — ince ayarda kullanılır
  2. Doğrulama — en iyi kontrol noktasını seçmek için kullanılır
  3. Sınama — eğitim sırasında hiç görülmez; ONLY son değerlendirme için kullanılır

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Yıkıcı Unutmaya Dikkat Edin

Dar kapsamlı veriler üzerinde ince ayar yapmak, modelin OTHER görevlerdeki başarısını düşürebilir. Yalnızca yeni uzmanlık alanınızda değil, geniş bir değerlendirme kümesinde de sınama yapın.

Kategori Bazında Raporlama

Değerlendirme kümenizi etiketleyin ve puanları kategori başına raporlayın:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Kalibrasyon

Ayarlanmış modeller çoğu zaman kendilerine aşırı güvenir. Doğruluğa ilişkin tahmin edilen olasılığı gerçek olasılıkla karşılaştırın; gerekirse kalibrasyon yapın.

Uzunluk ve Üslup Kayması

Ayarlanmış modeller eğitim dağılımına doğru kayar. Eğitim verileri daha kısaysa çıktılar da kısalır. Bu bazen istenir, bazen istenmez.

Gerçek Dünyada A/B Sınaması

Çevrimdışı değerlendirmelerin ötesine geçerek üretimde A/B sınaması yapın:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Kalite ve Maliyeti Karşılaştırma

Ayarlanmış model daha küçük ve daha ucuz olabilir. Toplam maliyet-kalite karşılaştırması:

  • Temel GPT-4o: çağrı başına X ABD doları, kalite Y
  • Ayarlanmış Llama 8B (kendi sunucunuzda barındırılan): çağrı başına X/10 ABD doları, kalite 0,9Y
  • Yeterince yüksek kalırsa büyük olasılıkla kazanan odur

Gizli Başarısızlık Biçimleri

Hasımca girdiler deneyin:

  • Güvenlik sınırlarını aşmaya çalışan istemler
  • Dağılım dışı girdiler
  • Uç durum istemleri

Bazen ince ayar, güvenliği zayıflatır; kullanıma sunmadan önce doğrulayın.

LLM Olarak Hakem Kullanmanın Sakıncası

Bir LLM hakemi kullanıyorsanız, ayarlanmış modelinizden DIFFERENT bir model ailesi kullanın. Aksi halde hakem taraflı biçimde yüksek puanlar verir.

Veri Kümesini Ne Zaman Yenilemeli?

Değerlendirme belirli kategorilerde gerileme gösteriyorsa:

  1. Üretim izlerinde benzer örnekleri bulun
  2. Bunları eğitim kümesine ekleyin
  3. Yeniden eğitin
  4. Yeniden değerlendirin

Geri Almak OK'dir

İnce ayar beklenenin altında kalırsa onu çöpe atıp yeniden deneyin. Batık maliyet, daha kötü bir modeli kullanıma sunmak için gerekçe değildir.

Yıkıcı Unutma

İnce ayarda yıkıcı unutma nedir?

Özet

Ayarlanmış modeli YOUR altın kümenize göre temel modelle değerlendirin. Kategori bazındaki gerilemeleri izleyin. Üretimde A/B sınaması yapın. Başarısı düşerse geri alın; kısmen başarılıysa veri kümesini yineleyin.

Sıkça Sorulan Sorular

“Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme” dersi ücretsiz mi?

Evet — “Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme” dersinde ne öğreneceğim?

Değerlendirme kümenizde temel modele karşı A/B karşılaştırması yapın — bazen ince ayar faydadan çok zarar verir. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.

“Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. İnce Ayarın İstem Yazmaktan Daha İyi Olduğu Durumlar
  2. Veri Toplama: İzler ve İz Tekrarı
  3. Maliyet Verimli Ayar için LoRA ve QLoRA
  4. Ayarlanmış Modelleri Temel Modelle Karşılaştırarak Değerlendirme
← AI Agents Sayfasına Dön