0Pricing
AI Prompt Engineering · Ders

Zararsızlık ve Faydalılık Gerilimi

Aşırı reddetme sorununu yönetme: güvenliği faydayla dengeleyen istemler.

Zararsızlık ve Faydalılık Gerilimi, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 3. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.

Temel Gerilim

Her yapay zekâ güvenlik sistemi temel bir gerilimle karşı karşıyadır: bir modeli daha sık reddederek daha güvenli hâle getirmek, meşru kullanıcılar için onu aynı zamanda daha az faydalı hâle getirir.

Herhangi bir tıbbi konuyu tartışmayı reddeden bir model, tehlikeli sağlık tavsiyesi vermeyecektir — ancak hemşirelere, doktorlara veya hastalara gerçekten yararlı bilgiler konusunda da yardımcı olamayacaktır. Amaç doğru kalibrasyondur: gerektiğinde reddedin, gerektiğinde yardımcı olun.

Aşırı Reddetme: Gerçek Sorun

Aşırı reddetme, modelin zararlı olanlara yüzeysel olarak benzeyen zararsız istekleri yanıtlamayı reddetmesiyle ortaya çıkar. Örnekler:

  • Hastalıkların nasıl yayıldığını açıklamayı reddetmek (tehlikeli gibi görünür, aslında halk sağlığı eğitimidir)
  • Bir kötü karakter yazmayı reddetmek (kurmacadır, onaylama değildir)
  • Bir çilingir çırağı için kilit açmayı açıklamayı reddetmek

Aşırı reddetme yalnızca can sıkıcı değildir — modeli güvenilmez kılar ve kullanıcıları daha az güvenli seçeneklere yönlendirir.

Kalibre Edilmiş Reddetme İçin İstem Yazma

Sistem istemleri, bağlamı ve amacı netleştirerek modellerin aşırı reddetmeden kaçınmasını sağlayabilir. Bağlam meşru olduğunda modelin çift kullanımlı konularla ilgilenmesine açıkça izin verin.

CALIBRATED_SYSTEM_PROMPT = (
    'You are a knowledgeable assistant for healthcare professionals.\n\n'
    'Your users are nurses, doctors, and medical students. '
    'When asked about medications, dosages, procedures, or medical conditions, '
    'provide accurate, detailed information appropriate for trained professionals.\n\n'
    'Do not add excessive safety disclaimers to every response. '
    'Your users are professionals who need direct, accurate information to do their jobs. '
    'If a question is genuinely outside appropriate bounds, explain specifically why '
    'rather than giving a vague refusal.'
)

# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questions

Reddetmek Yerine Nedenini Açıklama Kalıbı

Aşırı reddetmeyi azaltmada en etkili istem kalıplarından biri: modele, tam olarak yanıt veremiyorsa, kesin bir ret vermek yerine neleri yapıp neleri yapamayacağını ve nedenini açıklamasını öğretin.

EXPLAIN_WHY_PROMPT = (
    'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
    '- If you can answer fully: do so directly.\n'
    '- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
    '- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
    'and suggest where the user might get this information appropriately.\n\n'
    'Do not give generic refusals like "I cannot help with that." '
    'Always be specific about what you can and cannot do.'
)

# Example of bad refusal:
# 'I cannot help with information about medications.'

# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
#  For specific dosing for a patient with your described conditions, you should
#  consult a pharmacist or prescribing physician who has the full clinical picture.'

Yararlı Alternatifler Sunma

Bir model bir isteği reddetmek zorunda kaldığında, yapabileceği en yararlı şey kullanıcının aslında ihtiyaç duyduğu şeye ulaşması için alternatif bir yol sunmaktır. Alternatif içermeyen bir ret, kullanıcıyı çaresiz bırakır.

ALTERNATIVES_PROMPT = (
    'You are a helpful assistant. When you cannot fully fulfill a request:\n'
    '1. Acknowledge the request with empathy.\n'
    '2. Explain briefly and specifically what you can and cannot do.\n'
    '3. Offer the closest helpful alternative you can provide.\n'
    '4. Point to appropriate resources if relevant.\n\n'
    'Example: If asked to prescribe medication:\n'
    'Say: "I can explain how this class of medications works and what '
    'symptoms they address. For a prescription, you need to see a licensed '
    'physician who can evaluate your specific situation. Here is what I can '
    'tell you about the medication itself: ..."'
)

Temel Değişken Olarak Bağlam

Aynı soru, bağlama göre zararlı veya zararsız olabilir. İstem mühendisliği, modelin daha iyi kalibrasyon kararları verebilmesi için bağlamı açıkça ortaya koymalıdır.

# Context that changes calibration:

# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control

# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
    'You are assisting a team of emergency room nurses. '
    'Users ask clinical questions during patient care shifts. '
    'Provide direct clinical information including dosing thresholds, '
    'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)

# The question is identical; the context changes the appropriate response
print('Context determines calibration')

1000 Kullanıcı Zihinsel Modeli

Kalibrasyon için yararlı bir zihinsel model: aynı mesajı gönderen 1000 farklı kullanıcı hayal edin. Amaçlarının dağılımı nasıl olur?

  • 1000 kullanıcının 990'ı zararsız bir amaca sahipse: model muhtemelen yardımcı olmalıdır
  • 1000 kullanıcının 500'ü zararlı bir amaca sahipse: model dikkatli olmalıdır
  • 1000 kullanıcıdan 1'i felaket düzeyinde zarara yol açabiliyorsa: model ne olursa olsun reddetmelidir

Bu olasılıksal çerçeve hem aşırı reddetmeden (990 kullanıcıyı engellemekten) hem de yetersiz reddetmeden (enabling, yani 10 zararlı isteğin gerçekleştirilmesini mümkün kılmaktan) kaçınmaya yardımcı olur.

Güvenlik Gösterisinden Kaçınma

Güvenlik gösterisi, ihtiyatlı görünen ancak zararı gerçekten önlemeyen ve aynı zamanda meşru kullanıcılar için ürünü kötüleştiren güvenlik önlemlerini ifade eder.

Örnekler: Her tarife uyarı eklemek ('yemeden önce bir beslenme uzmanına danışın'). Tarihsel vahşetleri eğitim bağlamında tartışmayı reddetmek. these yanıtlar daha güvenli değildir — yalnızca yardımcı olmazlar.

# Avoid these patterns in your system prompts:

BAD_SYSTEM_PROMPT = (
    'Always add disclaimers to every response. '
    'Never discuss anything that could be dangerous. '
    'Refuse requests that mention weapons, drugs, or violence in any context. '
    'Always recommend consulting a professional for any question.'
    # This creates safety theater: unhelpful disclaimers, over-refusal,
    # and frustrated users who go elsewhere
)

GOOD_SYSTEM_PROMPT = (
    'Provide accurate, helpful information to users. '
    'Add safety information when it is directly relevant and actionable. '
    'Refuse requests only when providing the information would cause '
    'clear, concrete harm that outweighs the benefits to legitimate users. '
    'When declining, always explain specifically why and offer alternatives.'
)

Bir Güvenlik Mekanizması Olarak Sürtünme

Kesin retler yerine sürtünmeyi değerlendirin: zararlı kullanımları zorlaştırırken zararsız kullanımları akıcı tutan bir adım ekleyin. Bu, ikili reddetme/uyma yaklaşımından daha iyi kalibre edilmiştir.

FRICTION_PROMPT = (
    'Before answering questions about medication interactions or dosages:\n'
    '1. Ask: "Can you tell me a bit about the context — are you a healthcare '
    'provider, a patient, or a caregiver?"\n'
    '2. Use the answer to calibrate the detail level and framing.\n'
    '3. For patient/caregiver context: provide information with appropriate '
    'guidance to consult a prescriber for their specific situation.\n'
    '4. For healthcare provider context: provide clinical-level detail directly.\n\n'
    'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easily

Çift Gazete Testi

Çift Gazete Testi, retleri kalibre etmek için kullanılan sezgisel bir yöntemdir:

  • Gazete A (yapay zekâ güvenliği muhabiri): Bu yanıt zararlı veya sorumsuz olarak haberleştirilir miydi?
  • Gazete B (yapay zekâ abartısı muhabiri): Bu ret, paternalist, yararsız veya saçma olarak haberleştirilir miydi?

İyi kalibre edilmiş bir yanıt her iki testi de geçer: A tarafından zararlı olarak, B tarafından da gereksiz yere kısıtlayıcı olarak haberleştirilmez.

Kalibrasyonunuzu Test Etme

Sisteminizin kalibrasyonunu, her iki türü de içeren bir test kümesi oluşturarak ölçün:

  • Zararsız istekler — yanıtlanması gereken eğitim amaçlı, mesleki ve yaratıcı istekler
  • Zararlı istekler — reddedilmesi gereken istekler

Yanlış pozitif oranını (zararsız istekleri reddetme) ve yanlış negatif oranını (zararlı isteklere izin verme) izleyin. İyi ayarlanmış bir sistemin her iki oranı da düşüktür.

Bilgi Kontrolü: Aşırı Reddetme

Güvenlik kaygıları nedeniyle bir isteği tamamen yerine getiremeyen model için önerilen yaklaşım nedir?

Özet: Zararsızlık ve Faydalılık Gerilimi

Aşırı reddetme gerçek ve maliyetli bir sorundur: çok kolay reddeden modeller meşru kullanıcıları yarı yolda bırakır ve güveni aşındırır. Kalibre edilmiş reddetme, yalnızca somut zarar olası kullanıcıların yararından açıkça ağır bastığında reddetmek anlamına gelir. Temel kalıplar şunlardır: modelin daha iyi kararlar vermesine yardımcı olmak için sistem istemlerinde bağlam oluşturmak, 'reddetmek yerine nedenini açıklama' talimatını kullanmak, her zaman yararlı alternatifler sunmak ve güvenlik gösterisinden kaçınmak (her şeye uyarı eklememek). 1000 kullanıcı zihinsel modeli ve Çift Gazete Testi, doğru dengeyi bulmak için pratik sezgisel yöntemlerdir.

Sıkça Sorulan Sorular

“Zararsızlık ve Faydalılık Gerilimi” dersi ücretsiz mi?

Evet — “Zararsızlık ve Faydalılık Gerilimi” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.

“Zararsızlık ve Faydalılık Gerilimi” dersinde ne öğreneceğim?

Aşırı reddetme sorununu yönetme: güvenliği faydayla dengeleyen istemler. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 3. dersidir.

“Zararsızlık ve Faydalılık Gerilimi” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. CAI İlkeleri ve Eleştiri İstemleri
  2. Öz Eleştiri ve Gözden Geçirme Kalıpları
  3. Zararsızlık ve Faydalılık Gerilimi
  4. Uygulamalarda CAI Uygulama
← AI Prompt Engineering Sayfasına Dön