Spændingen mellem ufarlighed og hjælpsomhed
Håndtering af overdreven afvisning: prompts, der balancerer sikkerhed og anvendelighed.
Spændingen mellem ufarlighed og hjælpsomhed er en gratis Promptteknik til AI-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Promptteknik til AI, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Promptteknik til AI-kurset indeholder 4 lektioner i alt.
Den grundlæggende spænding
Ethvert AI-sikkerhedssystem står over for en grundlæggende spænding: Når en model gøres sikrere ved at afvise oftere, bliver den også mindre nyttig for legitime brugere.
En model, der nægter at diskutere noget som helst medicinsk, vil aldrig give farlige sundhedsråd — men den vil heller ikke hjælpe sygeplejersker, læger eller patienter med reelt nyttige oplysninger. Målet er kalibrering: Afvis, når du bør, og hjælp, når du bør.
Overdreven afvisning: Det egentlige problem
Overdreven afvisning opstår, når en model afslår at besvare harmløse anmodninger, fordi de overfladisk ligner skadelige anmodninger. Eksempler:
- At nægte at forklare, hvordan sygdomme spredes (lyder farligt, men er faktisk folkesundhedsoplysning)
- At nægte at skrive en skurkefigur (fiktion, ikke en billigelse)
- At nægte at forklare, hvordan man dirker låse, til en låsesmedelærling
Overdreven afvisning er ikke bare irriterende — det gør modellen utroværdig og skubber brugerne over mod mindre sikre alternativer.
Promptning til kalibrerede afvisninger
Systemprompter kan instruere modeller i at undgå overdreven afvisning ved at tydeliggøre kontekst og hensigt. Giv udtrykkeligt modellen tilladelse til at beskæftige sig med emner med dobbelt anvendelse, når konteksten er legitim.
CALIBRATED_SYSTEM_PROMPT = (
'You are a knowledgeable assistant for healthcare professionals.\n\n'
'Your users are nurses, doctors, and medical students. '
'When asked about medications, dosages, procedures, or medical conditions, '
'provide accurate, detailed information appropriate for trained professionals.\n\n'
'Do not add excessive safety disclaimers to every response. '
'Your users are professionals who need direct, accurate information to do their jobs. '
'If a question is genuinely outside appropriate bounds, explain specifically why '
'rather than giving a vague refusal.'
)
# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questionsMønstret »Forklar hvorfor i stedet for at afvise«
Et af de mest effektive promptmønstre til at reducere overdreven afvisning er at instruere modellen i, at den skal forklare, hvad den kan og ikke kan gøre, og hvorfor, hvis den ikke kan besvare spørgsmålet fuldt ud — i stedet for at give en kategorisk afvisning.
EXPLAIN_WHY_PROMPT = (
'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
'- If you can answer fully: do so directly.\n'
'- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
'- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
'and suggest where the user might get this information appropriately.\n\n'
'Do not give generic refusals like "I cannot help with that." '
'Always be specific about what you can and cannot do.'
)
# Example of bad refusal:
# 'I cannot help with information about medications.'
# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
# For specific dosing for a patient with your described conditions, you should
# consult a pharmacist or prescribing physician who has the full clinical picture.'Tilbyd nyttige alternativer
Når en model er nødt til at afslå en anmodning, er det mest nyttige, den kan gøre, at tilbyde en alternativ vej til det, brugeren faktisk har brug for. En afvisning uden alternativer efterlader brugeren uden hjælp.
ALTERNATIVES_PROMPT = (
'You are a helpful assistant. When you cannot fully fulfill a request:\n'
'1. Acknowledge the request with empathy.\n'
'2. Explain briefly and specifically what you can and cannot do.\n'
'3. Offer the closest helpful alternative you can provide.\n'
'4. Point to appropriate resources if relevant.\n\n'
'Example: If asked to prescribe medication:\n'
'Say: "I can explain how this class of medications works and what '
'symptoms they address. For a prescription, you need to see a licensed '
'physician who can evaluate your specific situation. Here is what I can '
'tell you about the medication itself: ..."'
)Kontekst som den afgørende variabel
Det samme spørgsmål kan være skadeligt eller harmløst afhængigt af konteksten. Promptudformningen bør fastlægge konteksten tydeligt, så modellen kan træffe bedre kalibreringsbeslutninger.
# Context that changes calibration:
# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control
# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
'You are assisting a team of emergency room nurses. '
'Users ask clinical questions during patient care shifts. '
'Provide direct clinical information including dosing thresholds, '
'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)
# The question is identical; the context changes the appropriate response
print('Context determines calibration')Den mentale model med 1000 brugere
En nyttig mental model til kalibrering er at forestille sig 1000 forskellige brugere, der sender den samme besked. Hvordan er fordelingen af hensigter?
- Hvis 990 ud af 1000 har harmløse hensigter, bør modellen sandsynligvis hjælpe
- Hvis 500 ud af 1000 har skadelige hensigter, bør modellen være forsigtig
- Hvis 1 ud af 1000 potentielt kan forårsage katastrofal skade, bør modellen afvise uanset hvad
Denne sandsynlighedsbaserede tilgang hjælper med at undgå både overdreven afvisning (at blokere de 990) og utilstrækkelig afvisning (at muliggøre skade for de 10).
Undgå sikkerhedsteater
Sikkerhedsteater betegner sikkerhedsforanstaltninger, der ser forsigtige ud, men ikke faktisk forhindrer skade — samtidig med at de gør produktet dårligere for legitime brugere.
Eksempler: At tilføje ansvarsfraskrivelser til enhver opskrift (»Tal med en ernæringsekspert, før du spiser«). At nægte at diskutere historiske grusomheder i en undervisningskontekst. Disse svar er ikke sikrere — de er bare unyttige.
# Avoid these patterns in your system prompts:
BAD_SYSTEM_PROMPT = (
'Always add disclaimers to every response. '
'Never discuss anything that could be dangerous. '
'Refuse requests that mention weapons, drugs, or violence in any context. '
'Always recommend consulting a professional for any question.'
# This creates safety theater: unhelpful disclaimers, over-refusal,
# and frustrated users who go elsewhere
)
GOOD_SYSTEM_PROMPT = (
'Provide accurate, helpful information to users. '
'Add safety information when it is directly relevant and actionable. '
'Refuse requests only when providing the information would cause '
'clear, concrete harm that outweighs the benefits to legitimate users. '
'When declining, always explain specifically why and offer alternatives.'
)Friktion som sikkerhedsmekanisme
I stedet for kategoriske afvisninger kan du overveje friktion: Tilføj et trin, der gør skadelige anvendelser vanskeligere, samtidig med at harmløse anvendelser forbliver enkle. Det er mere kalibreret end et binært valg mellem at afvise og efterkomme.
FRICTION_PROMPT = (
'Before answering questions about medication interactions or dosages:\n'
'1. Ask: "Can you tell me a bit about the context — are you a healthcare '
'provider, a patient, or a caregiver?"\n'
'2. Use the answer to calibrate the detail level and framing.\n'
'3. For patient/caregiver context: provide information with appropriate '
'guidance to consult a prescriber for their specific situation.\n'
'4. For healthcare provider context: provide clinical-level detail directly.\n\n'
'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easilyDen dobbelte avistest
Den dobbelte avistest er en tommelfingerregel til kalibrering af afvisninger:
- Avis A (AI-sikkerhedsreporter): Ville dette svar blive omtalt som skadeligt eller uansvarligt?
- Avis B (reporter, der skriver om AI-overdrivelser): Ville denne afvisning blive omtalt som bedrevidende, unyttig eller absurd?
Et velkalibreret svar består begge test: Det bliver ikke omtalt som skadeligt af A og heller ikke som unødigt restriktivt af B.
Test din kalibrering
Mål systemets kalibrering ved at opbygge et testsæt med begge dele:
- Harmløse anmodninger, der bør besvares (undervisningsmæssige, professionelle og kreative)
- Skadelige anmodninger, der bør afslås
Følg andelen af falske positive (afvisning af harmløse anmodninger) og andelen af falske negative (tilladelse af skadelige anmodninger). Et velindstillet system har lave andele af begge.
Videnstjek: Overdreven afvisning
Hvad er den anbefalede tilgang, når en model ikke kan imødekomme en anmodning fuldt ud på grund af sikkerhedshensyn?
Opsamling: Spændingen mellem harmløshed og hjælpsomhed
Overdreven afvisning er et reelt og kostbart problem: Modeller, der afviser for rundhåndet, svigter legitime brugere og undergraver tilliden. Kalibreret afvisning betyder kun at afslå, når den konkrete skade tydeligt opvejer fordelen for de sandsynlige brugere. Vigtige mønstre er at etablere kontekst i systemprompter for at hjælpe modellen med at træffe bedre beslutninger, bruge instruktionen »forklar hvorfor i stedet for at afvise«, altid tilbyde nyttige alternativer og undgå sikkerhedsteater (ansvarsfraskrivelser på alt). Den mentale model med 1000 brugere og den dobbelte avistest er praktiske tommelfingerregler til at finde den rette balance.
Lær Promptteknik til AI med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 199
Ofte stillede spørgsmål
Er lektionen “Spændingen mellem ufarlighed og hjælpsomhed” gratis?
Ja — alle 3 lektioner i læringssporet Promptteknik til AI, inklusive “Spændingen mellem ufarlighed og hjælpsomhed”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Promptteknik til AI-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Spændingen mellem ufarlighed og hjælpsomhed”?
Håndtering af overdreven afvisning: prompts, der balancerer sikkerhed og anvendelighed. Du øver dig i Promptteknik til AI med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Promptteknik til AI?
Der kræves ingen tidligere erfaring. Promptteknik til AI på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.
Hvor lang tid tager lektionen “Spændingen mellem ufarlighed og hjælpsomhed”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Promptteknik til AI-lektion?
Ja. Alle Promptteknik til AI-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- CAI-principper og kritikprompts
- Mønstre for selvkritik og revision
- Spændingen mellem ufarlighed og hjælpsomhed
- Implementering af CAI i applikationer