Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft
Übermäßige Verweigerungen vermeiden: Prompts, die Sicherheit und praktischen Nutzen ausbalancieren.
Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Das grundlegende Spannungsfeld
Jedes KI-Sicherheitssystem steht vor einem grundlegenden Spannungsfeld: Ein Modell sicherer zu machen, indem es häufiger Anfragen verweigert, macht es für legitime Nutzer auch weniger hilfreich.
Ein Modell, das jede medizinische Diskussion verweigert, wird niemals gefährliche Gesundheitsratschläge geben — aber es wird auch Pflegekräften, Ärzten oder Patienten keine wirklich nützlichen Informationen liefern. Kalibrierung ist das Ziel: Verweigern Sie, wenn Sie sollten, und helfen Sie, wenn Sie sollten.
Übermäßige Verweigerung: Das eigentliche Problem
Übermäßige Verweigerung tritt auf, wenn ein Modell harmlose Anfragen ablehnt, weil diese oberflächlich schädlichen Anfragen ähneln. Beispiele:
- Eine Erklärung zu verweigern, wie sich Krankheiten verbreiten (klingt gefährlich, ist aber tatsächlich Aufklärung im Bereich der öffentlichen Gesundheit)
- Sich zu weigern, eine Schurkenfigur zu schreiben (Fiktion, keine Befürwortung)
- Die Erklärung des Schlösserknackens für einen angehenden Schlosser zu verweigern
Übermäßige Verweigerung ist nicht nur ärgerlich — sie macht das Modell unzuverlässig und drängt Nutzer zu weniger sicheren Alternativen.
Prompting für kalibrierte Verweigerung
System-Prompts können Modelle anweisen, übermäßige Verweigerung zu vermeiden, indem sie Kontext und Absicht klären. Geben Sie dem Modell ausdrücklich die Erlaubnis, sich mit Themen mit Dual-Use-Charakter auseinanderzusetzen, wenn der Kontext legitim ist.
CALIBRATED_SYSTEM_PROMPT = (
'You are a knowledgeable assistant for healthcare professionals.\n\n'
'Your users are nurses, doctors, and medical students. '
'When asked about medications, dosages, procedures, or medical conditions, '
'provide accurate, detailed information appropriate for trained professionals.\n\n'
'Do not add excessive safety disclaimers to every response. '
'Your users are professionals who need direct, accurate information to do their jobs. '
'If a question is genuinely outside appropriate bounds, explain specifically why '
'rather than giving a vague refusal.'
)
# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questionsDas Muster „Erklären statt verweigern“
Eines der wirksamsten Prompting-Muster zur Verringerung übermäßiger Verweigerung: Weisen Sie das Modell an, dass es wenn es nicht vollständig antworten kann erklären soll, was es tun kann und was nicht und warum — statt einfach vollständig zu verweigern.
EXPLAIN_WHY_PROMPT = (
'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
'- If you can answer fully: do so directly.\n'
'- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
'- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
'and suggest where the user might get this information appropriately.\n\n'
'Do not give generic refusals like "I cannot help with that." '
'Always be specific about what you can and cannot do.'
)
# Example of bad refusal:
# 'I cannot help with information about medications.'
# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
# For specific dosing for a patient with your described conditions, you should
# consult a pharmacist or prescribing physician who has the full clinical picture.'Hilfreiche Alternativen anbieten
Wenn ein Modell eine Anfrage ablehnen muss, kann es am hilfreichsten einen alternativen Weg zu dem anbieten, was der Nutzer tatsächlich benötigt. Eine Verweigerung ohne Alternativen lässt den Nutzer nicht weiterkommen.
ALTERNATIVES_PROMPT = (
'You are a helpful assistant. When you cannot fully fulfill a request:\n'
'1. Acknowledge the request with empathy.\n'
'2. Explain briefly and specifically what you can and cannot do.\n'
'3. Offer the closest helpful alternative you can provide.\n'
'4. Point to appropriate resources if relevant.\n\n'
'Example: If asked to prescribe medication:\n'
'Say: "I can explain how this class of medications works and what '
'symptoms they address. For a prescription, you need to see a licensed '
'physician who can evaluate your specific situation. Here is what I can '
'tell you about the medication itself: ..."'
)Kontext als entscheidende Variable
Dieselbe Frage kann je nach Kontext schädlich oder harmlos sein. Prompt Engineering sollte den Kontext klar festlegen, damit das Modell besser kalibrierte Entscheidungen treffen kann.
# Context that changes calibration:
# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control
# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
'You are assisting a team of emergency room nurses. '
'Users ask clinical questions during patient care shifts. '
'Provide direct clinical information including dosing thresholds, '
'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)
# The question is identical; the context changes the appropriate response
print('Context determines calibration')Das Denkmodell der 1000 Nutzer
Ein nützliches Denkmodell für die Kalibrierung: Stellen Sie sich 1000 verschiedene Nutzer vor, die dieselbe Nachricht senden. Wie verteilt sich die Absicht?
- Wenn 990/1000 eine harmlose Absicht haben: Das Modell sollte wahrscheinlich helfen
- Wenn 500/1000 eine schädliche Absicht haben: Das Modell sollte vorsichtig sein
- Wenn bei 1/1000 katastrophaler Schaden verursacht werden könnte: Das Modell sollte unabhängig davon verweigern
Diese probabilistische Betrachtungsweise hilft, sowohl übermäßige Verweigerung (Blockieren der 990) als auch unzureichende Verweigerung (Ermöglichen der 10) zu vermeiden.
Sicherheitstheater vermeiden
Sicherheitstheater bezeichnet Sicherheitsmaßnahmen, die zwar vorsichtig wirken, Schaden aber nicht wirklich verhindern und das Produkt gleichzeitig für legitime Nutzer verschlechtern.
Beispiele: Jedem Rezept einen Haftungsausschluss hinzufügen („Konsultieren Sie vor dem Essen eine Ernährungsfachkraft“). Sich weigern, historische Gräueltaten in einem Bildungskontext zu besprechen. Diese Antworten sind nicht sicherer — sie sind einfach nur nicht hilfreich.
# Avoid these patterns in your system prompts:
BAD_SYSTEM_PROMPT = (
'Always add disclaimers to every response. '
'Never discuss anything that could be dangerous. '
'Refuse requests that mention weapons, drugs, or violence in any context. '
'Always recommend consulting a professional for any question.'
# This creates safety theater: unhelpful disclaimers, over-refusal,
# and frustrated users who go elsewhere
)
GOOD_SYSTEM_PROMPT = (
'Provide accurate, helpful information to users. '
'Add safety information when it is directly relevant and actionable. '
'Refuse requests only when providing the information would cause '
'clear, concrete harm that outweighs the benefits to legitimate users. '
'When declining, always explain specifically why and offer alternatives.'
)Reibung als Sicherheitsmechanismus
Erwägen Sie anstelle einer vollständigen Verweigerung den Einsatz von Reibung: Fügen Sie einen Schritt hinzu, der schädliche Nutzung erschwert, während harmlose Nutzung reibungslos bleibt. Das ist besser kalibriert als eine binäre Entscheidung zwischen Verweigern und Erfüllen.
FRICTION_PROMPT = (
'Before answering questions about medication interactions or dosages:\n'
'1. Ask: "Can you tell me a bit about the context — are you a healthcare '
'provider, a patient, or a caregiver?"\n'
'2. Use the answer to calibrate the detail level and framing.\n'
'3. For patient/caregiver context: provide information with appropriate '
'guidance to consult a prescriber for their specific situation.\n'
'4. For healthcare provider context: provide clinical-level detail directly.\n\n'
'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easilyDer Dual-Newspaper-Test
Der Dual-Newspaper-Test ist eine Heuristik zur Kalibrierung von Verweigerungen:
- Zeitung A (Berichterstattung über KI-Sicherheit): Würde diese Antwort als schädlich oder unverantwortlich dargestellt?
- Zeitung B (Berichterstattung über KI-Übertreibungen): Würde diese Verweigerung als bevormundend, nicht hilfreich oder absurd dargestellt?
Eine gut kalibrierte Antwort besteht beide Tests: Zeitung A stellt sie nicht als schädlich dar, und Zeitung B stellt die Verweigerung nicht als unnötig restriktiv dar.
Ihre Kalibrierung testen
Messen Sie die Kalibrierung Ihres Systems, indem Sie einen Testsatz erstellen, der beides enthält:
- Harmlose Anfragen, die beantwortet werden sollten (Bildung, Beruf, Kreativität)
- Schädliche Anfragen, die abgelehnt werden sollten
Verfolgen Sie die Rate falsch-positiver Ergebnisse (Verweigerung harmloser Anfragen) und die Rate falsch-negativer Ergebnisse (Zulassen schädlicher Anfragen). Ein gut abgestimmtes System weist bei beiden Raten niedrige Werte auf.
Wissensprüfung: Übermäßige Verweigerung
Welcher Ansatz wird empfohlen, wenn ein Modell eine Anfrage aufgrund von Sicherheitsbedenken nicht vollständig erfüllen kann?
Rückblick: Spannungsfeld zwischen Unschädlichkeit und Hilfsbereitschaft
Übermäßige Verweigerung ist ein reales und kostspieliges Problem: Modelle, die zu großzügig verweigern, lassen legitime Nutzer im Stich und untergraben das Vertrauen. Kalibrierte Verweigerung bedeutet, nur dann abzulehnen, wenn der konkrete Schaden den Nutzen für die wahrscheinlichen Nutzer eindeutig überwiegt. Zentrale Muster: Legen Sie den Kontext in System-Prompts fest, damit das Modell bessere Entscheidungen treffen kann, verwenden Sie die Anweisung „Erklären statt verweigern“, bieten Sie immer hilfreiche Alternativen an und vermeiden Sie Sicherheitstheater (Haftungsausschlüsse für alles). Das Denkmodell der 1000 Nutzer und der Dual-Newspaper-Test sind praktische Heuristiken, um das richtige Gleichgewicht zu finden.
Häufig gestellte Fragen
Ist die Lektion „Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft“ kostenlos?
Ja — der vollständige Text von „Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft“?
Übermäßige Verweigerungen vermeiden: Prompts, die Sicherheit und praktischen Nutzen ausbalancieren. Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- CAI-Prinzipien und Kritik-Prompts
- Muster für Selbstkritik und Überarbeitung
- Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft
- CAI in Anwendungen implementieren