Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench
Kodlama aracıları (SWE-Bench), genel asistanlar (GAIA) ve araç kullanımı (ToolBench) için herkese açık kıyaslamalar.
Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.
Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.
Herkese Açık Kıyaslamalar
Modelleri ve çerçeveleri ekipler arasında karşılaştırmak için herkese açık kıyaslamalar gereklidir. Yaygın aracı yeteneklerini kapsarlar:
- SWE-Bench — yazılım mühendisliği görevleri
- GAIA — genel asistan görevleri
- ToolBench / BFCL — araç kullanımı
- WebArena — tarayıcıda gezinme
SWE-Bench
SWE-Bench, bir aracının gerçek GitHub sorunlarını çözüp çözemediğini sınar:
- Popüler Python depolarından 2294 gerçek sorun
- Aracının tüm gizli sınamalardan geçen bir yama üretmesi gerekir
- En ileri düzey aracı sistemler artık %50-70'ini çözüyor (2023'te %5'ten azdı)
SWE-Bench Verified
OpenAI, daha sıkı kalite kontrollerine sahip 500 sorunluk bir alt küme yayımladı (SWE-Bench Verified). Bu, sektör standardıdır.
GAIA
Genel Yapay Zekâ Asistanı kıyaslaması (Meta + HF, 2023):
- Üç zorluk düzeyine yayılmış 466 soru
- Web'de gezinme, kod çalıştırma ve çok kipli akıl yürütme gerektirir
- Bir insanın yaklaşık 30 saniye harcayacağı şekilde tasarlanmıştır; en iyi aracılar yaklaşık %60'a ulaşır
Örnek GAIA Sorusu
"Mercedes Sosa'nın 1972 ile 1985 arasında yayımlanan kaç stüdyo albümü vardır? İngilizce Wikipedia sayfasındaki listeyi kullanın."
Web'de gezinme, tablo okuma ve sayma gerektirir — çok adımlı aracı görevlerine özgü bir örnektir.
Berkeley İşlev Çağırma Liderlik Tablosu (BFCL)
Araç çağırma değerlendirmesi için standart:
- Binlerce (sorgu, araç tanımı, beklenen çağrı) üçlüsü
- Basit, paralel ve aracın atlandığı senaryoları kapsar
- Üç ayda bir güncellenir
ToolBench
Daha büyük ama daha dağınık: RapidAPI'den 16 binden fazla API, çok adımlı araç zincirleri. BFCL kadar kanonik değil, ancak kapsamı daha geniş.
WebArena
Web'de gezinen aracılar için açık kaynaklı kıyaslama. Dört kendi içinde bağımsız web sitesini barındırır (e-ticaret, forum, geliştirici portalı, GitLab); aracılar gerçekçi görevleri tamamlamalıdır.
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4Kıyaslamaların Sınırlamaları
- Herkese açık kıyaslamalar eğitim verilerine sızar (sistemi yanıltarak yüksek puan alma riski)
- Tek alanlıdır — göreviniz daha zor veya daha kolay olabilir
- "X'in yüzde kaçını çöz" ifadesi hangi X'ten söz edildiğini gizler — uzun kuyruk önemlidir
Kendi Kıyaslamanız Daha Önemlidir
Herkese açık kıyaslamalar yaklaşımları karşılaştırmak için yararlıdır. Ancak YOUR verileriniz üzerindeki kendi altın kümeniz, YOUR ürününüz için önemli olan tek sayıdır.
Dahili ve Genel Kıyaslamaları Birleştirme
Sağlıklı ekip uygulaması:
- Öncü düzeydeki yeteneği izlemek için herkese açık kıyaslamaları üç ayda bir çalıştırın
- Dahili değerlendirmeleri her PR'da çalıştırın
- Kararlar için dahili sayılara güvenin; alanı takip etmek için genel sayıları kullanın
Kıyaslama Sonuçlarını Okuma
Bir makale "SWE-Bench'te %75" dediğinde:
- WHICH SWE-Bench olduğunu kontrol edin (Lite, Verified, tam sürüm)
- Birden fazla denemeye izin verilip verilmediğini kontrol edin
- Gizli araçlar / ipuçları kullanıp kullanmadıklarını kontrol edin
Başlık sayılarının yanlış yorumlanması kolaydır.
Dahili ve Genel Değerlendirmeler
Ürününüz için daha önemli olan WHICH?
Özet
Kod aracıları için SWE-Bench, genel asistanlar için GAIA, araç kullanımı için BFCL, tarayıcılar için WebArena. Alanı takip etmek için bunları kullanın; kararlar için kendi değerlendirmenize güvenin.
Sıkça Sorulan Sorular
“Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench” dersi ücretsiz mi?
Evet — “Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.
“Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench” dersinde ne öğreneceğim?
Kodlama aracıları (SWE-Bench), genel asistanlar (GAIA) ve araç kullanımı (ToolBench) için herkese açık kıyaslamalar. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Agents öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.
“Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Aracılar için Değerlendirme Odaklı Geliştirme
- Altın Sınama Kümesi Oluşturma
- LLM'yi Hakem Olarak Kullanmanın Tuzakları
- Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench