Yapay Zeka Çıktılarını Okuma ve Değerlendirme
Yapay zeka yanıtlarının ilgililiğini, doğruluğunu ve eksiksizliğini değerlendirme ölçütleri.
Yapay Zeka Çıktılarını Okuma ve Değerlendirme, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
Değerlendirmenin Önemi
Bir yapay zekâ yanıtı almak işin yalnızca yarısıdır. İkinci yarısı, bu yanıtın gerçekten iyi olup olmadığını değerlendirmektir.
Açık bir değerlendirme çerçevesi olmadan, düzgün görünen ancak yanlış soruyu yanıtlayan bir yanıtı kabul edebilir veya beklediğiniz biçimde düzenlenmediği için gerçekten yararlı bir yanıtı reddedebilirsiniz.
Yapay zekâ çıktılarının kalitesini güvenilir biçimde değerlendirme becerisi, istem mühendisliğindeki en pratik becerilerden biridir.
Dört Değerlendirme Ölçütü
Bir yapay zekâ yanıtını okurken onu dört boyutta değerlendirin:
- İlgililik — Sorduğunuz asıl soruyu yanıtladı mı?
- Doğruluk — Bilgiler gerçeğe uygun mu?
- Eksiksizlik — İstemin tüm bölümlerini kapsadı mı?
- Biçim — İhtiyacınız olan şekilde yapılandırılmış mı?
Bir yanıt üç ölçütte yüksek puan alırken dördüncüsünde başarısız olabilir. Her ölçüt bağımsız olarak önem taşır.
Ölçüt 1: Uygunluk
Uygunluk şu soruyu gündeme getirir: model gerçekten sorduğunuz soruyu mu yanıtladı, yoksa ilgili ancak farklı bir soruyu mu yanıtladı?
Örnek: "Sağlık hizmetlerinde LLM kullanmanın riskleri nelerdir?" diye sorarsınız ve model, LLM çalışma biçimine dair genel bir açıklamayla yanıt verir. Bu yanıt doğru olabilir, ancak uygun değildir; asıl noktayı kaçırmıştır.
Uygunluğu kontrol etmek için özgün isteminizi yeniden okuyun ve şu soruyu sorun: yanıt sorduğum şeyi doğrudan ele alıyor mu?
Ölçüt 2: Doğruluk
Doğruluk şu soruyu gündeme getirir: yanıttaki gerçekler, sayılar ve iddialar doğru mu?
Yapay zekâ modelleri halüsinasyon üretebilir; doğruymuş gibi kendinden emin bir biçimde aslında yanlış bilgiler verebilirler. Yaygın doğruluk sorunları şunlardır:
- Yanlış istatistikler veya tarihler
- Yanlış kişilere atfedilen alıntılar
- Güncelmiş gibi sunulan güncelliğini yitirmiş bilgiler
- Uydurma kaynaklar veya atıflar
Gerçeğe dayalı konularda, çıktıyı kullanmadan önce temel iddiaları her zaman güvenilir bir kaynakla doğrulayın.
Ölçüt 3: Eksiksizlik
Eksiksizlik şu soruyu gündeme getirir: yanıt, isteğinizin tüm bölümlerini kapsadı mı?
İsteminizin birden fazla bölümü varsa — "X'i açıklayın, üç örnek listeleyin ve bir sonraki adımı önerin" gibi — modelin yalnızca ilk bölümü değil, üçünü de ele aldığını kontrol edin.
Özellikle istem uzun olduğunda modeller çok bölümlü bir isteğin son kısmını bazen atlar. Yanıtı isteminizle madde madde karşılaştırarak okumak, eksiksizliği kontrol etmenin en güvenilir yoludur.
Ölçüt 4: Biçim
Biçim şu soruyu gündeme getirir: yanıt, ihtiyacınız olan şekilde yapılandırılmış mı?
Mükemmel derecede doğru ve eksiksiz bir yanıt bile biçimi yanlışsa kullanılması zor olabilir. Yaygın biçim uyumsuzlukları şunlardır:
- Madde points gerektiğinde düzyazı kullanılması
- Özete ihtiyaç duyduğunuzda uzun bir deneme sunulması
- Gezinmeyi kolaylaştıracak başlıkların eksik olması
- Açıklamasız kod veya kodsuz açıklamalar
Biçim sorunları, çoğu zaman bir takip istemiyle düzeltilmesi en kolay sorunlardır.
Basit Bir Değerlendirme Kontrol Listesi
Herhangi bir yapay zekâ yanıtı aldıktan sonra şu zihinsel kontrol listesini uygulayın:
- Uygunluk: Gerçek sorumu yanıtlıyor mu?
- Doğruluk: Gerçeklere güvenebilir miyim? Neleri doğrulamam gerekir?
- Eksiksizlik: İsteğimin tüm bölümlerini kapsadı mı?
- Biçim: Kullanabileceğim bir şekilde yapılandırılmış mı?
Herhangi bir ölçüt karşılanmıyorsa, bu size tam olarak ne tür bir takip istemi yazmanız gerektiğini gösterir. Her ölçüt, belirli bir düzeltme türünü gösterir (points).
Kodda Değerlendirme: Bir Yanıta Puan Verme
İkinci bir LLM çağrısını kullanarak her ölçüte göre bir yanıtı puanlayan hafif bir Python değerlendirme sarmalayıcısı oluşturabilirsiniz:
import openai
client = openai.OpenAI(api_key='sk-...')
def evaluate_response(original_prompt, response_text):
eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.
Original prompt: {original_prompt}
AI response: {response_text}
Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?
Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''
result = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': eval_prompt}]
)
return result.choices[0].message.contentUygunluk Sorunları: Yaygın Örüntüler
Uygunluk sorunları genellikle öngörülebilir örüntüler izler. Bunları tanımak değerlendirmenizi hızlandırır:
- Konu sapması — Model doğru bir başlangıç yapar, ardından ilgili bir konuya yönelir
- Sorunun değiştirilmesi — Model, sorunuzun daha basit veya kolay bir sürümünü yanıtlar
- Aşırı genelleme — Belirli bir durumu sorarsınız, model genel durumu yanıtlar
- Kısıtın yok sayılması — Bir bağlam belirtirsiniz (örneğin, "yeni başlayanlar için"), ancak model bunu yok sayar
Her örüntü, takip isteminizde belirli bir düzeltme yapılması gerektiğini gösterir.
Dikkat Edilmesi Gereken Doğruluk Uyarı İşaretleri
Bir iddiayı hemen doğrulayamasanız bile bazı işaretler doğruluğun daha düşük olabileceğini gösterir:
- Kaynak belirtilmeden verilen çok kesin sayılar
- Fazla uygun veya tam isabetli görünen iddialar
- Başlıkları ve yazarları belirtilen araştırmalara, makalelere veya kitaplara yapılan göndermeler
- Tarihler ve sürüm numaraları (bunlar sık sık değişir)
- Hukuki, tıbbi veya mali ayrıntılar
Bunlar hata kanıtı değildir, ancak yüksek riskli bir bağlamda çıktıyı kullanmadan önce iki kez kontrol etmeye değer unsurlardır.
Daha İyi Takip İstemleri Yazmak İçin Değerlendirmeyi Kullanma
Değerlendirmenin asıl değeri, karşılanmayan her ölçütün doğrudan belirli bir takip istemi türüne karşılık gelmesidir:
- Uygunluk sorunu → "X'i yanıtladınız, ancak ben Y'yi soruyordum. Lütfen Y'ye odaklanın."
- Doğruluk endişesi → "Lütfen Z hakkındaki iddiayı iki kez kontrol edin ve dayanağınızı belirtin."
- Eksiksizlik sorunu → "Sorununuzun üçüncü bölümünü ele almadınız. Lütfen onu da ekleyin."
- Biçim sorunu → "Bunu, üstte tek satırlık bir özet olacak şekilde madde points biçiminde yeniden yazın."
Değerlendirme ve takip istemi yazma, bir geri bildirim döngüsü olarak işler.
Bilgi Kontrolü: Değerlendirme Ölçütleri
Modele şu soruyu sorarsınız: "En iyi 5 Python web çatısını, her biri için tek cümlelik bir açıklamayla listeleyin." Model, Python'ın tarihini ve web geliştirmedeki yükselişini anlatan, iyi yazılmış uzun bir yazıyla yanıt verir; Flask ve Django'dan kısaca söz eder, ancak 5 çatı listelemez.
Bu yanıt en kritik biçimde hangi ölçütü karşılamaz?
Özet: Yapay Zekâ Çıktılarını Okuma ve Değerlendirme
Etkili istem yazma iki aşamalı bir süreçtir: istemi hazırlamak ve yanıtı değerlendirmek.
Dört ölçüt — Uygunluk, Doğruluk, Eksiksizlik, Biçim — herhangi bir yapay zekâ çıktısını sistemli biçimde değerlendirmenizi sağlar. Karşılanmayan her ölçüt, tam olarak ne tür bir takip istemi yazmanız gerektiğini gösterir.
Bir sonraki derste, belirli sorun türlerini düzeltmek için bu takip istemlerini yazma alıştırması yapacaksınız.
Yapay zeka eğitmeniyle AI Prompt Engineering öğren — ücretsiz
Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.
- Kurslar
- 53
- Dersler
- 199
Sıkça Sorulan Sorular
“Yapay Zeka Çıktılarını Okuma ve Değerlendirme” dersi ücretsiz mi?
Evet — “Yapay Zeka Çıktılarını Okuma ve Değerlendirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
“Yapay Zeka Çıktılarını Okuma ve Değerlendirme” dersinde ne öğreneceğim?
Yapay zeka yanıtlarının ilgililiğini, doğruluğunu ve eksiksizliğini değerlendirme ölçütleri. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.
“Yapay Zeka Çıktılarını Okuma ve Değerlendirme” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Yapay Zeka Çıktılarını Okuma ve Değerlendirme
- Etkili Takip İstemleri Yazma
- Önceki Yanıtlar Üzerine İnşa Etme
- İyileştirmek mi, Baştan Başlamak mı?