Spenningen mellom ufarlighet og hjelpsomhet
Håndtere overdreven avvisning: prompter som balanserer sikkerhet og nytte.
Spenningen mellom ufarlighet og hjelpsomhet er en gratis leksjon i AI-prompt engineering på CoddyKit. Dette er leksjon 3 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i AI-prompt engineering, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i AI-prompt engineering inneholder totalt 4 leksjoner.
Den grunnleggende spenningen
Alle AI-sikkerhetssystemer står overfor en grunnleggende spenning: Når en modell blir sikrere ved å avslå oftere, blir den også mindre nyttig for legitime brukere.
En modell som nekter å diskutere noe som helst medisinsk, vil aldri gi farlige helseråd – men den vil heller ikke hjelpe sykepleiere, leger eller pasienter med genuint nyttig informasjon. Målet er god kalibrering: avslå når det bør gjøres, og hjelp når det bør gjøres.
Overavvisning: Det virkelige problemet
Overavvisning oppstår når en modell avslår å svare på harmløse forespørsler fordi de på overflaten ligner på skadelige forespørsler. Eksempler:
- Å avslå å forklare hvordan sykdommer sprer seg (høres farlig ut, men er faktisk folkehelseundervisning)
- Å avslå å skrive en skurkefigur (fiksjon, ikke en støtteerklæring)
- Å avslå å forklare låsdirking for en lærling i låsesmedfaget
Overavvisning er ikke bare irriterende – det gjør modellen upålitelig og sender brukerne videre til mindre sikre alternativer.
Prompting for kalibrerte avslag
Systemprompter kan instruere modeller til å unngå overavvisning ved å tydeliggjøre kontekst og hensikt. Gi modellen uttrykkelig tillatelse til å behandle temaer med dobbelt bruksområde når konteksten er legitim.
CALIBRATED_SYSTEM_PROMPT = (
'You are a knowledgeable assistant for healthcare professionals.\n\n'
'Your users are nurses, doctors, and medical students. '
'When asked about medications, dosages, procedures, or medical conditions, '
'provide accurate, detailed information appropriate for trained professionals.\n\n'
'Do not add excessive safety disclaimers to every response. '
'Your users are professionals who need direct, accurate information to do their jobs. '
'If a question is genuinely outside appropriate bounds, explain specifically why '
'rather than giving a vague refusal.'
)
# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questionsMønsteret «Forklar hvorfor i stedet for å avslå»
Et av de mest effektive promptmønstrene for å redusere overavvisning er å instruere modellen om at hvis den ikke kan svare fullt ut, skal den forklare hva den kan og ikke kan gjøre, og hvorfor – i stedet for å gi et blankt avslag.
EXPLAIN_WHY_PROMPT = (
'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
'- If you can answer fully: do so directly.\n'
'- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
'- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
'and suggest where the user might get this information appropriately.\n\n'
'Do not give generic refusals like "I cannot help with that." '
'Always be specific about what you can and cannot do.'
)
# Example of bad refusal:
# 'I cannot help with information about medications.'
# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
# For specific dosing for a patient with your described conditions, you should
# consult a pharmacist or prescribing physician who has the full clinical picture.'Å tilby nyttige alternativer
Når en modell må avslå en forespørsel, er det mest nyttige den kan gjøre å tilby en alternativ vei til det brukeren faktisk trenger. Et avslag uten alternativer gjør brukeren stående fast.
ALTERNATIVES_PROMPT = (
'You are a helpful assistant. When you cannot fully fulfill a request:\n'
'1. Acknowledge the request with empathy.\n'
'2. Explain briefly and specifically what you can and cannot do.\n'
'3. Offer the closest helpful alternative you can provide.\n'
'4. Point to appropriate resources if relevant.\n\n'
'Example: If asked to prescribe medication:\n'
'Say: "I can explain how this class of medications works and what '
'symptoms they address. For a prescription, you need to see a licensed '
'physician who can evaluate your specific situation. Here is what I can '
'tell you about the medication itself: ..."'
)Kontekst som nøkkelvariabel
Det samme spørsmålet kan være skadelig eller harmløst avhengig av konteksten. Promptutforming bør etablere konteksten tydelig, slik at modellen kan ta bedre kalibreringsbeslutninger.
# Context that changes calibration:
# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control
# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
'You are assisting a team of emergency room nurses. '
'Users ask clinical questions during patient care shifts. '
'Provide direct clinical information including dosing thresholds, '
'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)
# The question is identical; the context changes the appropriate response
print('Context determines calibration')Tankemodellen med 1000 brukere
En nyttig tankemodell for kalibrering er å forestille seg 1000 forskjellige brukere som sender den samme meldingen. Hvordan fordeler hensiktene seg?
- Hvis 990 av 1000 har harmløs hensikt, bør modellen sannsynligvis hjelpe
- Hvis 500 av 1000 har skadelig hensikt, bør modellen være forsiktig
- Hvis 1 av 1000 kan forårsake katastrofal skade, bør modellen avslå uansett
Denne sannsynlighetsbaserte måten å tenke på bidrar til å unngå både overavvisning (å blokkere de 990) og underavvisning (å legge til rette for de 10).
Å unngå sikkerhetsteater
Sikkerhetsteater viser til sikkerhetstiltak som ser forsiktige ut, men som egentlig ikke hindrer skade – samtidig som de gjør produktet dårligere for legitime brukere.
Eksempler er å legge til ansvarsfraskrivelser i alle oppskrifter («rådfør deg med en ernæringsfysiolog før du spiser») og å nekte å diskutere historiske grusomheter i en pedagogisk kontekst. Slike svar er ikke sikrere – de er bare lite nyttige.
# Avoid these patterns in your system prompts:
BAD_SYSTEM_PROMPT = (
'Always add disclaimers to every response. '
'Never discuss anything that could be dangerous. '
'Refuse requests that mention weapons, drugs, or violence in any context. '
'Always recommend consulting a professional for any question.'
# This creates safety theater: unhelpful disclaimers, over-refusal,
# and frustrated users who go elsewhere
)
GOOD_SYSTEM_PROMPT = (
'Provide accurate, helpful information to users. '
'Add safety information when it is directly relevant and actionable. '
'Refuse requests only when providing the information would cause '
'clear, concrete harm that outweighs the benefits to legitimate users. '
'When declining, always explain specifically why and offer alternatives.'
)Friksjon som sikkerhetsmekanisme
I stedet for bastante avslag bør De vurdere friksjon: Legg til et trinn som gjør skadelig bruk vanskeligere, samtidig som harmløs bruk forblir enkel. Dette er mer kalibrert enn et binært avslag eller en etterkommelse.
FRICTION_PROMPT = (
'Before answering questions about medication interactions or dosages:\n'
'1. Ask: "Can you tell me a bit about the context — are you a healthcare '
'provider, a patient, or a caregiver?"\n'
'2. Use the answer to calibrate the detail level and framing.\n'
'3. For patient/caregiver context: provide information with appropriate '
'guidance to consult a prescriber for their specific situation.\n'
'4. For healthcare provider context: provide clinical-level detail directly.\n\n'
'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easilyTesten med to aviser
Testen med to aviser er en heuristikk for å kalibrere avslag:
- Avis A (reporter om AI-sikkerhet): Ville dette svaret blitt omtalt som skadelig eller uansvarlig?
- Avis B (reporter om AI-overdrivelse): Ville dette avslaget blitt omtalt som paternalistisk, lite nyttig eller absurd?
Et godt kalibrert svar består begge testene: Det blir ikke omtalt som skadelig av A, og avslaget blir ikke omtalt som unødvendig begrensende av B.
Testing av kalibreringen
Mål systemets kalibrering ved å bygge et testsett som inneholder begge deler:
- Harmløse forespørsler som bør besvares (pedagogiske, profesjonelle og kreative)
- Skadelige forespørsler som bør avslås
Følg med på frekvensen av falske positive (harmløse forespørsler som avslås) og frekvensen av falske negative (skadelige forespørsler som tillates). Et godt innstilt system har lave verdier på begge.
Kunnskapstest: Overavvisning
Hva er den anbefalte fremgangsmåten når en modell ikke kan oppfylle en forespørsel fullt ut på grunn av sikkerhetshensyn?
Oppsummering: Spenningen mellom harmløshet og hjelpsomhet
Overavvisning er et reelt og kostbart problem: Modeller som avslår for ofte, svikter legitime brukere og svekker tilliten. Kalibrerte avslag betyr å avslå bare når den konkrete skaden klart veier tyngre enn nytten for de sannsynlige brukerne. Viktige mønstre er å etablere kontekst i systemprompter for å hjelpe modellen med å ta bedre beslutninger, bruke instruksjonen «forklar hvorfor i stedet for å avslå», alltid tilby nyttige alternativer og unngå sikkerhetsteater (ansvarsfraskrivelser på alt). Tankemodellen med 1000 brukere og testen med to aviser er praktiske heuristikker for å finne riktig balanse.
Lær deg AI-prompt engineering med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 53
- Leksjoner
- 199
Ofte stilte spørsmål
Er leksjonen «Spenningen mellom ufarlighet og hjelpsomhet» gratis?
Ja – du kan lese valgfritt 3 av leksjonene i læringsstien AI-prompt engineering, inkludert «Spenningen mellom ufarlighet og hjelpsomhet», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i AI-prompt engineering inneholder totalt 4 leksjoner.
Hva lærer jeg i «Spenningen mellom ufarlighet og hjelpsomhet»?
Håndtere overdreven avvisning: prompter som balanserer sikkerhet og nytte. Du øver på AI-prompt engineering med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med AI-prompt engineering?
Ingen tidligere erfaring er nødvendig. AI-prompt engineering på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.
Hvor lang tid tar leksjonen «Spenningen mellom ufarlighet og hjelpsomhet»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne AI-prompt engineering-leksjonen?
Ja. Alle AI-prompt engineering-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- CAI-prinsipper og kritikkprompter
- Mønstre for selvkritikk og revisjon
- Spenningen mellom ufarlighet og hjelpsomhet
- Implementere CAI i applikasjoner