0Pricing
AI Prompt Engineering · Ders

CAI İlkeleri ve Eleştiri İstemleri

Anthropic'in Anayasal Yapay Zekası: zararsızlık ilkelerine dayalı öz eleştiri.

CAI İlkeleri ve Eleştiri İstemleri, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.

Anayasal Yapay Zekâ Nedir?

Anayasal Yapay Zekâ (CAI), Anthropic'in yazılı ilkelerden oluşan bir küme, yani bir anayasa kullanarak yapay zekâ sistemlerini yararlı, zararsız ve dürüst olacak şekilde eğitme yöntemidir.

CAI, zararlı çıktıları işaretlemeleri için yalnızca insan etiketleyicilere güvenmek yerine modelin kendi yanıtlarını anayasaya göre eleştirmesini ve gözden geçirmesini sağlar. Bu yaklaşım hem daha ölçeklenebilir hem de daha tutarlıdır.

Anayasa: Yazılı İlkeler

CAI anayasası, modelin uyması gereken ilkelerin bir listesidir. Anthropic'in yayımladığı anayasa şu kaynaklardan türetilen ilkeleri içerir:

  • UN İnsan Hakları Evrensel Bildirgesi
  • Apple'ın App Store yönergeleri
  • Anthropic'in zarardan kaçınmaya ilişkin kurum içi yönergeleri

Example ilkesi: "Zararlı, etik dışı, ırkçı, cinsiyetçi, zehirli, tehlikeli veya yasa dışı içerik barındırma olasılığı en düşük yanıtı seçin."

CAI Döngüsünün Üç Adımı

Anayasal Yapay Zekâ, yanıtları iyileştirmek için üç adımlı bir süreç kullanır:

  1. Oluşturma: Model, başlangıçta bir yanıt üretir (bu yanıt zararlı olabilir)
  2. Eleştirme: Model, yanıtı bir ilkeye göre değerlendirir
  3. Gözden geçirme: Model, eleştiriyi ele alacak şekilde yanıtı yeniden yazar

Bu döngü bir kez veya birden çok kez çalıştırılabilir. Her yineleme, yanıtı anayasayla daha uyumlu hale getirir.

1. Adım: Başlangıç Yanıtı Oluşturma

İlk adım, herhangi bir özel kısıtlama olmadan kullanıcının isteğine bir yanıt üretmektir. Bu yanıt yararlı olabilir; ancak aynı zamanda potansiyel olarak zararlı, yanlı veya hatalı da olabilir.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

2. Adım: Bir İlkeye Göre Eleştirme

Eleştirme adımında model, kendi başlangıç yanıtını ve belirli bir ilkeyi alır; ardından yanıtın bu ilkeyi nasıl ihlal ettiğini veya bu ilkeyi daha iyi nasıl karşılayabileceğini belirler.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

3. Adım: Eleştiriye Göre Gözden Geçirme

Gözden geçirme adımında model, eleştiriyi alır ve belirlenen sorunları ele alan, mümkün olduğunca yararlı yeni ve iyileştirilmiş bir yanıt üretir.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

Uygulanacak İlkeleri Seçme

CAI anayasasında çok sayıda ilke vardır. Bunların tümünü her yanıta uygulamazsınız; bu yavaş ve gereksiz tekrar içeren bir süreç olur.

Uygulamada, alanla veya risk düzeyiyle ilgili ilkeleri seçersiniz:

  • Yüksek riskli alanlar: 3-5 güvenlik ilkesi uygulayın
  • Genel asistan: geniş ölçüde uygulanabilir 1-2 ilke uygulayın
  • Yaratıcı yazım: yasallık ve müstehcen içerikle ilgili ilkeleri uygulayın
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

RLHF'de CAI: SL-CAI ve RLCAI

Anthropic, CAI'yi eğitimin iki aşamasında kullanır:

  • SL-CAI: Denetimli Öğrenme; eleştiri-gözden geçirme çiftleri oluşturur ve gözden geçirilmiş yanıtları modelin ince ayarını yapmak için kullanır
  • RLCAI: Pekiştirmeli Öğrenme; insan tercihi etiketleri yerine CAI ile eğitilmiş bir tercih modelini ödül sinyali olarak kullanır

İstem mühendisi olarak CAI ilkelerini uygulamalarınızda çıkarım zamanında uygularsınız; eğitim altyapısı olmadan aynı eleştiri-gözden geçirme mantığını kullanırsınız.

Yararlı, Zararsız ve Dürüst — HHH Çerçevesi

Anthropic'in eğitim hedefi HHH çerçevesidir:

  • Yararlı: Kullanıcıya isteği konusunda gerçekten yardımcı olur
  • Zararsız: Kullanıcılara, üçüncü taraflara veya topluma zarar vermekten kaçınır
  • Dürüst: Aldatmaz ve sahip olmadığı bir kesinlik iddiasında bulunmaz

Bu üç hedef bazen çatışır; CAI'nin eleştiri-gözden geçirme süreci, üçünü de aynı anda karşılayan yanıtları bulmak üzere tasarlanmıştır.

CAI Eleştiri İstemi Şablonu

Uygulamalarınıza uyarlayabileceğiniz güvenilir bir eleştiri istemi şablonu:

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

CAI Döngüleri Ne Zaman Uygulanmalı?

Her yanıtın bir eleştiri-gözden geçirme döngüsüne ihtiyacı yoktur. CAI'yi şu durumlarda uygulayın:

  • İstek yüksek riskli bir alandaysa (sağlık, hukuk veya güvenlik)
  • Başlangıç yanıtı kaçamak veya potansiyel olarak zararlı görünüyorsa
  • Uygulamanızın katı içerik gereksinimleri varsa
  • Çıktıyı kullanıcılara göstermeden önce bir kalite denetimi istiyorsanız

Düşük riskli, rutin sorgularda gecikmeyi ve maliyeti azaltmak için CAI'yi atlayın.

Bilgi Kontrolü: CAI'nin Üç Adımlı Döngüsü

Anayasal Yapay Zekâ eleştiri döngüsündeki adımların doğru sırası nedir?

Özet: CAI İlkeleri ve Eleştiri İstemleri

Anayasal Yapay Zekâ üç adımlı bir döngü kullanır: başlangıç yanıtını oluşturur, yazılı bir ilkeye göre eleştirir ve daha iyi bir çıktı üretmek için yanıtı gözden geçirir. Anayasa; yararlılığı, zararsızlığı ve dürüstlüğü önceliklendiren ilkelerin bir listesidir. Anthropic, CAI'yi hem denetimli ince ayar hem de RLHF aşamalarında uygular. Uygulama düzeyinde, API çağrılarını kullanarak aynı eleştiri-gözden geçirme mantığını çıkarım zamanında uygularsınız. Güvenliği gecikme ve maliyetle dengelemek için CAI'yi yüksek riskli alanlarda seçici biçimde uygulayın.

Sıkça Sorulan Sorular

“CAI İlkeleri ve Eleştiri İstemleri” dersi ücretsiz mi?

Evet — “CAI İlkeleri ve Eleştiri İstemleri” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.

“CAI İlkeleri ve Eleştiri İstemleri” dersinde ne öğreneceğim?

Anthropic'in Anayasal Yapay Zekası: zararsızlık ilkelerine dayalı öz eleştiri. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.

“CAI İlkeleri ve Eleştiri İstemleri” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. CAI İlkeleri ve Eleştiri İstemleri
  2. Öz Eleştiri ve Gözden Geçirme Kalıpları
  3. Zararsızlık ve Faydalılık Gerilimi
  4. Uygulamalarda CAI Uygulama
← AI Prompt Engineering Sayfasına Dön