0Pricing
AI Agents · Ders

RAG Değerlendirmesi (RAGAS, Recall@K)

Değişikliklerin yararlı olup olmadığını anlamak için sadakati, yanıtla ilgiyi, bağlam kesinliğini ve recall@K değerini ölçün.

RAG Değerlendirmesi (RAGAS, Recall@K), CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Ölçemediğinizi İyileştiremezsiniz

RAG'de birçok ayar vardır: parça boyutu, en iyi K, yeniden sıralayıcı, istem ve model. Ölçümler olmadan her değişiklik tahminden ibarettir.

RAG İçin Temel Ölçümler

  1. Getirme: doğru parçaları getirdik mi?
  2. Bağlama bağlılık: yanıt parçalara dayalı kalıyor mu?
  3. Yanıt uygunluğu: yanıt soruyu ele alıyor mu?
  4. Bağlam kesinliği/hatırlaması: getirilen yararlı parçaların oranı

Hatırlama@K

(soru, uygun-parça-kimlikleri-listesi) çiftlerinden oluşan bir referans kümesi oluşturun. En iyi K getirilen parçanın ne sıklıkla uygun bir parça içerdiğini ölçün:

def recall_at_k(eval_set, k=5):
    hits = 0
    for item in eval_set:
        retrieved = retriever(item['question'], k=k)
        if any(c.id in item['relevant_ids'] for c in retrieved):
            hits += 1
    return hits / len(eval_set)

Kesinlik@K

Getirilen parçaların hangi oranı uygundur?

def precision_at_k(eval_set, k=5):
    total_relevant = 0
    total_retrieved = 0
    for item in eval_set:
        retrieved = retriever(item['question'], k=k)
        total_relevant += sum(1 for c in retrieved if c.id in item['relevant_ids'])
        total_retrieved += k
    return total_relevant / total_retrieved

MRR (Ortalama Karşılıklı Sıra)

İlk uygun belge ne kadar üst sırada yer alıyor?

def mrr(eval_set, k=10):
    total = 0
    for item in eval_set:
        retrieved = retriever(item['question'], k=k)
        for rank, c in enumerate(retrieved, start=1):
            if c.id in item['relevant_ids']:
                total += 1 / rank
                break
    return total / len(eval_set)

Bağlama Bağlılık (LLM ile Değerlendirme)

Yanıttaki her iddianın bağlam tarafından desteklenip desteklenmediğini denetlemek için bir LLM kullanın:

judge_prompt = '''
Given the context and answer, identify each factual claim in the answer.
For each claim, judge whether the context supports it.
Return {claims: [{claim, supported: true/false}]}.
'''
result = judge_llm.invoke(judge_prompt.format(context=ctx, answer=ans))

Yanıt Uygunluğu

Tersine değerlendirme yapın: bir LLM'ye "Bu yanıt, bu sorunun yanıtı olabilir mi?" diye sorun. Konu dışı çıktıları yakalar.

RAGAS Çerçevesi

RAGAS, yukarıdaki ölçümleri otomatikleştirir:

# pip install ragas
from ragas import evaluate
from ragas.metrics import faithfulness, answer_relevancy, context_precision, context_recall

results = evaluate(
    dataset,            # HF dataset with question, contexts, answer, ground_truth
    metrics=[faithfulness, answer_relevancy, context_precision, context_recall]
)
print(results)

Referans Kümesi Oluşturma

İnsanlar tarafından derlenmiş 20-200 (soru, beklenen_yanıt, uygun_parçalar) demeti. Şunları kapsayın:

  • Yaygın sorgular
  • Sınır durumları
  • Zorlayıcı girdiler (derlem dışı sorular)

Yapay Değerlendirme Kümeleri

Başlangıç oluşturma: LLM'den belgelerinizden soru-cevap çiftleri oluşturmasını isteyin. Kalitesi daha düşüktür, ancak hızlıdır:

synth_prompt = 'Read this document and write 3 questions a user might ask, with answers from the doc:\n{doc}'
# Use as a starting point; humans curate later.
print(synth_prompt)

LangSmith ve Langfuse Veri Kümeleri

Her iki araç da üretim izlerini değerlendirme veri kümelerine dönüştürmenizi sağlar. Kötü sonuç veren 50 gerçek soru seçin, doğru yanıtları etiketleyin ve bunu kıyas ölçütünüz olarak kullanın.

Tek Bir Ölçütü Aşırı İyileştirmeyin

Hatırlama@K değerini en üst düzeye çıkarmak, Kesinlik@K değerine zarar verebilir (çok fazla yanlış pozitif oluşur). Birden çok ölçümü ve bileşik bir ölçütü izleyin.

Üretimde A/B Sınamaları

Kullanıcı memnuniyetiyle ilişkili bir çevrim dışı değerlendirme elde ettiğinizde, üretimdeki değişiklikleri A/B sınamasına tabi tutabilir ve hem ölçümleri hem de kullanıcıların beğeni oranlarını karşılaştırabilirsiniz.

Hatırlama@K Tanımı

Hatırlama@5 = 0,8 ne anlama gelir?

Özet

Bir referans kümesi oluşturun. Hatırlama@K, Kesinlik@K, MRR, Bağlama Bağlılık ve Yanıt Uygunluğunu ölçün. Otomatikleştirmek için RAGAS kullanın. Ölçümlerinize göre yineleyin.

Sıkça Sorulan Sorular

“RAG Değerlendirmesi (RAGAS, Recall@K)” dersi ücretsiz mi?

Evet — “RAG Değerlendirmesi (RAGAS, Recall@K)” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“RAG Değerlendirmesi (RAGAS, Recall@K)” dersinde ne öğreneceğim?

Değişikliklerin yararlı olup olmadığını anlamak için sadakati, yanıtla ilgiyi, bağlam kesinliğini ve recall@K değerini ölçün. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.

“RAG Değerlendirmesi (RAGAS, Recall@K)” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Çapraz Kodlayıcılarla Yeniden Sıralama
  2. HyDE: Varsayımsal Belge Gömüntüleri
  3. Çoklu Vektör Getirme (ColBERT)
  4. RAG Değerlendirmesi (RAGAS, Recall@K)
← AI Agents Sayfasına Dön