Tekoälyn prompt engineering · Oppitunti

Haitattomuuden ja hyödyllisyyden välinen jännite

Liiallisten kieltäytymisten hallinta: kehotteet, joissa turvallisuus ja hyödyllisyys ovat tasapainossa

Oppitunti 3/413 vaihetta

Haitattomuuden ja hyödyllisyyden välinen jännite on ilmainen Tekoälyn prompt engineering-oppitunti CoddyKitissä. Tämä on oppitunti 3/4. Voit lukea tästä oppimispolusta kokonaan mitkä tahansa 3 oppituntia ilmaiseksi — sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä käytännön harjoittelun sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppitunti kuuluu Tekoälyn prompt engineering-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Tekoälyn prompt engineering-kurssilla on yhteensä 4 oppituntia.

Keskeinen jännite

Jokainen tekoälyn turvallisuusjärjestelmä kohtaa perustavanlaatuisen jännitteen: mallin tekeminen turvallisemmaksi kieltäytymällä useammin tekee siitä samalla vähemmän hyödyllisen asiallisille käyttäjille.

Malli, joka kieltäytyy keskustelemasta kaikesta lääketieteeseen liittyvästä, ei koskaan anna vaarallisia terveysneuvoja — mutta se ei myöskään auta sairaanhoitajia, lääkäreitä tai potilaita aidosti hyödyllisillä tiedoilla. Tavoitteena on asianmukainen kalibrointi: kieltäytyä silloin, kun pitää, ja auttaa silloin, kun pitää.

Liiallinen kieltäytyminen: todellinen ongelma

Liiallista kieltäytymistä tapahtuu, kun malli kieltäytyy vastaamasta harmittomiin pyyntöihin, koska ne muistuttavat pinnallisesti haitallisia pyyntöjä. Esimerkkejä:

  • Kieltäytyminen selittämästä, miten sairaudet leviävät (kuulostaa vaaralliselta, mutta on tosiasiassa kansanterveysvalistusta)
  • Kieltäytyminen kirjoittamasta pahishahmoa (fiktiota, ei hyväksyntää)
  • Kieltäytyminen selittämästä lukkojen tiirikointia lukkosepän harjoittelijalle

Liiallinen kieltäytyminen ei ole vain ärsyttävää — se tekee mallista epäluotettavan ja ohjaa käyttäjät vähemmän turvallisiin vaihtoehtoihin.

Kehotukset kalibroituun kieltäytymiseen

Järjestelmäpromptit voivat ohjeistaa mallia välttämään liiallista kieltäytymistä täsmentämällä asiayhteyden ja tarkoituksen. Antakaa mallille nimenomaisesti lupa käsitellä kaksikäyttöisiä aiheita, kun asiayhteys on asianmukainen.

CALIBRATED_SYSTEM_PROMPT = (
    'You are a knowledgeable assistant for healthcare professionals.\n\n'
    'Your users are nurses, doctors, and medical students. '
    'When asked about medications, dosages, procedures, or medical conditions, '
    'provide accurate, detailed information appropriate for trained professionals.\n\n'
    'Do not add excessive safety disclaimers to every response. '
    'Your users are professionals who need direct, accurate information to do their jobs. '
    'If a question is genuinely outside appropriate bounds, explain specifically why '
    'rather than giving a vague refusal.'
)

# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questions

Malli: perustele kieltäytymisen sijaan

Yksi tehokkaimmista promptisuunnittelun malleista liiallisen kieltäytymisen vähentämiseen on ohjeistaa mallia, että jos se ei voi vastata kattavasti, sen pitäisi kertoa, mitä se voi ja ei voi tehdä ja miksi — eikä antaa pelkkää kieltäytymistä.

EXPLAIN_WHY_PROMPT = (
    'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
    '- If you can answer fully: do so directly.\n'
    '- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
    '- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
    'and suggest where the user might get this information appropriately.\n\n'
    'Do not give generic refusals like "I cannot help with that." '
    'Always be specific about what you can and cannot do.'
)

# Example of bad refusal:
# 'I cannot help with information about medications.'

# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
#  For specific dosing for a patient with your described conditions, you should
#  consult a pharmacist or prescribing physician who has the full clinical picture.'

Hyödyllisten vaihtoehtojen tarjoaminen

Kun mallin on kieltäydyttävä pyynnöstä, hyödyllisintä on tarjota vaihtoehtoinen tapa auttaa käyttäjää saavuttamaan se, mitä hän todella tarvitsee. Kieltäytyminen ilman vaihtoehtoja jättää käyttäjän pulaan.

ALTERNATIVES_PROMPT = (
    'You are a helpful assistant. When you cannot fully fulfill a request:\n'
    '1. Acknowledge the request with empathy.\n'
    '2. Explain briefly and specifically what you can and cannot do.\n'
    '3. Offer the closest helpful alternative you can provide.\n'
    '4. Point to appropriate resources if relevant.\n\n'
    'Example: If asked to prescribe medication:\n'
    'Say: "I can explain how this class of medications works and what '
    'symptoms they address. For a prescription, you need to see a licensed '
    'physician who can evaluate your specific situation. Here is what I can '
    'tell you about the medication itself: ..."'
)

Asiayhteys avainmuuttujana

Sama kysymys voi olla haitallinen tai harmiton asiayhteydestä riippuen. Promptisuunnittelussa asiayhteys on määritettävä selkeästi, jotta malli voi tehdä parempia kalibrointipäätöksiä.

# Context that changes calibration:

# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control

# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
    'You are assisting a team of emergency room nurses. '
    'Users ask clinical questions during patient care shifts. '
    'Provide direct clinical information including dosing thresholds, '
    'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)

# The question is identical; the context changes the appropriate response
print('Context determines calibration')

Tuhannen käyttäjän ajatusmalli

Hyödyllinen kalibroinnin ajatusmalli on kuvitella, että 1 000 eri käyttäjää lähettää saman viestin. Millainen aikomusten jakauma on?

  • Jos 990/1 000 käyttäjällä on harmiton aikomus: mallin pitäisi todennäköisesti auttaa
  • Jos 500/1 000 käyttäjällä on haitallinen aikomus: mallin pitäisi olla varovainen
  • Jos 1/1 000 tapauksesta voisi aiheutua katastrofaalista haittaa: mallin pitäisi kieltäytyä joka tapauksessa

Tämä todennäköisyyspohjainen tarkastelu auttaa välttämään sekä liiallisen kieltäytymisen (990 käyttäjän estämisen) että liian vähäisen kieltäytymisen (10 käyttäjän mahdollistaman haitan).

Näennäisturvallisuuden välttäminen

Näennäisturvallisuudella tarkoitetaan turvallisuustoimia, jotka vaikuttavat varovaisilta mutta eivät tosiasiassa estä haittoja — samalla kun ne heikentävät tuotetta asiallisten käyttäjien kannalta.

Esimerkkejä: Vastuuvapauslausekkeiden lisääminen jokaiseen reseptiin ('keskustele ravitsemusterapeutin kanssa ennen syömistä'). Kieltäytyminen keskustelemasta historiallisista julmuuksista opetustilanteessa. Tällaiset vastaukset eivät ole turvallisempia — ne ovat vain hyödyttömiä.

# Avoid these patterns in your system prompts:

BAD_SYSTEM_PROMPT = (
    'Always add disclaimers to every response. '
    'Never discuss anything that could be dangerous. '
    'Refuse requests that mention weapons, drugs, or violence in any context. '
    'Always recommend consulting a professional for any question.'
    # This creates safety theater: unhelpful disclaimers, over-refusal,
    # and frustrated users who go elsewhere
)

GOOD_SYSTEM_PROMPT = (
    'Provide accurate, helpful information to users. '
    'Add safety information when it is directly relevant and actionable. '
    'Refuse requests only when providing the information would cause '
    'clear, concrete harm that outweighs the benefits to legitimate users. '
    'When declining, always explain specifically why and offer alternatives.'
)

Kitka turvallisuusmekanismina

Harkitkaa jyrkkien kieltäytymisten sijaan kitkaa: lisätkää vaihe, joka vaikeuttaa haitallista käyttöä mutta pitää harmittoman käytön sujuvana. Tämä on paremmin kalibroitu ratkaisu kuin vaihtoehto, jossa joko kieltäydytään tai suostutaan.

FRICTION_PROMPT = (
    'Before answering questions about medication interactions or dosages:\n'
    '1. Ask: "Can you tell me a bit about the context — are you a healthcare '
    'provider, a patient, or a caregiver?"\n'
    '2. Use the answer to calibrate the detail level and framing.\n'
    '3. For patient/caregiver context: provide information with appropriate '
    'guidance to consult a prescriber for their specific situation.\n'
    '4. For healthcare provider context: provide clinical-level detail directly.\n\n'
    'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easily

Kaksoissanomatesti

Kaksoissanomatesti on heuristiikka kieltäytymisten kalibrointiin:

  • Sanomalehti A (tekoälyn turvallisuudesta raportoiva toimittaja): Raportoitaisiinko tämä vastaus haitallisena tai vastuuttomana?
  • Sanomalehti B (tekoälyn hypetyksestä raportoiva toimittaja): Raportoitaisiinko tämä kieltäytyminen holhoavana, hyödyttömänä tai järjettömänä?

Hyvin kalibroitu vastaus läpäisee molemmat testit: A ei raportoisi sitä haitallisena eikä B kieltäytymistä tarpeettoman rajoittavana.

Kalibroinnin testaaminen

Mitattakaa järjestelmänne kalibrointi rakentamalla testijoukko, joka sisältää molemmat seuraavat:

  • Harmittomat pyynnöt, joihin pitäisi vastata (koulutukselliset, ammatilliset ja luovat)
  • Haitalliset pyynnöt, joista pitäisi kieltäytyä

Seuratkaa väärien positiivisten osuutta (harmittomista pyynnöistä kieltäytyminen) ja väärien negatiivisten osuutta (haitallisten pyyntöjen salliminen). Hyvin viritetyssä järjestelmässä molemmat osuudet ovat pieniä.

Tietotesti: liiallinen kieltäytyminen

Mitä suositellaan tehtäväksi, kun malli ei turvallisuussyistä voi toteuttaa pyyntöä kokonaan?

Kertaus: haitattomuuden ja hyödyllisyyden välinen jännite

Liiallinen kieltäytyminen on todellinen ja kallis ongelma: liian helposti kieltäytyvät mallit pettävät asialliset käyttäjät ja heikentävät luottamusta. Kalibroitu kieltäytyminen tarkoittaa kieltäytymistä vain silloin, kun konkreettinen haitta on selvästi suurempi kuin todennäköisten käyttäjien saama hyöty. Keskeiset mallit ovat asiayhteyden määrittäminen järjestelmäprompteissa parempien päätösten tukemiseksi, ohjeen 'perustele kieltäytymisen sijaan' käyttäminen, hyödyllisten vaihtoehtojen tarjoaminen aina sekä näennäisturvallisuuden välttäminen (vastuuvapauslausekkeet kaikkialla). Tuhannen käyttäjän ajatusmalli ja Kaksoissanomatesti ovat käytännöllisiä heuristiikkoja oikean tasapainon löytämiseen.

Aloita maksutta

Opi Tekoälyn prompt engineering tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
53
Oppitunnit
199

Usein kysytyt kysymykset

Onko oppitunti ”Haitattomuuden ja hyödyllisyyden välinen jännite” ilmainen?

Kyllä — voit lukea täällä verkossa kokonaan ilmaiseksi mitkä tahansa Tekoälyn prompt engineering-oppimispolun 3 oppituntia, myös oppitunnin “Haitattomuuden ja hyödyllisyyden välinen jännite”. Sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä interaktiiviset harjoitukset sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Tekoälyn prompt engineering-kurssilla on yhteensä 4 oppituntia.

Mitä opin oppitunnilla ”Haitattomuuden ja hyödyllisyyden välinen jännite”?

Liiallisten kieltäytymisten hallinta: kehotteet, joissa turvallisuus ja hyödyllisyys ovat tasapainossa Harjoittelet Tekoälyn prompt engineering-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Tekoälyn prompt engineering-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Tekoälyn prompt engineering-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 3/4.

Kuinka kauan ”Haitattomuuden ja hyödyllisyyden välinen jännite”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Tekoälyn prompt engineering-oppitunnilla?

Kyllä. Jokainen Tekoälyn prompt engineering-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. CAI-periaatteet ja kritiikkikehotteet
  2. Itsekritiikki- ja korjausmallit
  3. Haitattomuuden ja hyödyllisyyden välinen jännite
  4. CAI:n toteuttaminen sovelluksissa
← Takaisin: Tekoälyn prompt engineering