Tension entre innocuité et utilité
Gérez le refus excessif grâce à des prompts qui équilibrent sécurité et utilité.
Tension entre innocuité et utilité est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.
La tension fondamentale
Tout système de sécurité fondé sur l'IA est confronté à une tension fondamentale : rendre un modèle plus sûr en lui faisant davantage refuser les demandes le rend également moins utile pour les utilisateurs légitimes.
Un modèle qui refuse de discuter de tout sujet médical ne donnera jamais de conseils de santé dangereux — mais il n'aidera pas non plus les infirmiers, les médecins ou les patients à obtenir des informations réellement utiles. L'objectif est un bon calibrage : refuser lorsque c'est nécessaire, aider lorsque c'est nécessaire.
Le refus excessif : le vrai problème
Le refus excessif se produit lorsqu'un modèle refuse de répondre à des demandes inoffensives parce qu'elles ressemblent superficiellement à des demandes dangereuses. Exemples :
- Refuser d'expliquer comment les maladies se propagent (cela semble dangereux, mais relève en réalité de l'éducation à la santé publique)
- Refuser d'écrire un personnage de méchant (il s'agit de fiction, pas d'une approbation)
- Refuser d'expliquer le crochetage d'une serrure à un apprenti serrurier
Le refus excessif n'est pas seulement agaçant : il rend le modèle peu fiable et pousse les utilisateurs vers des solutions moins sûres.
Formuler des invites pour calibrer les refus
Les invites système peuvent demander aux modèles d'éviter les refus excessifs en clarifiant le contexte et l'intention. Autorisez explicitement le modèle à traiter les sujets à double usage lorsque le contexte est légitime.
CALIBRATED_SYSTEM_PROMPT = (
'You are a knowledgeable assistant for healthcare professionals.\n\n'
'Your users are nurses, doctors, and medical students. '
'When asked about medications, dosages, procedures, or medical conditions, '
'provide accurate, detailed information appropriate for trained professionals.\n\n'
'Do not add excessive safety disclaimers to every response. '
'Your users are professionals who need direct, accurate information to do their jobs. '
'If a question is genuinely outside appropriate bounds, explain specifically why '
'rather than giving a vague refusal.'
)
# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questionsLe modèle « expliquer pourquoi plutôt que refuser »
L'un des modèles d'invite les plus efficaces pour réduire les refus excessifs consiste à demander au modèle que, s'il ne peut pas répondre complètement, il explique ce qu'il peut et ne peut pas faire, ainsi que pourquoi — plutôt que de formuler un refus catégorique.
EXPLAIN_WHY_PROMPT = (
'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
'- If you can answer fully: do so directly.\n'
'- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
'- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
'and suggest where the user might get this information appropriately.\n\n'
'Do not give generic refusals like "I cannot help with that." '
'Always be specific about what you can and cannot do.'
)
# Example of bad refusal:
# 'I cannot help with information about medications.'
# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
# For specific dosing for a patient with your described conditions, you should
# consult a pharmacist or prescribing physician who has the full clinical picture.'Proposer des solutions utiles
Lorsqu'un modèle doit refuser une demande, la chose la plus utile qu'il puisse faire est de proposer une autre voie permettant de répondre au besoin réel de l'utilisateur. Un refus sans solution de remplacement laisse l'utilisateur sans issue.
ALTERNATIVES_PROMPT = (
'You are a helpful assistant. When you cannot fully fulfill a request:\n'
'1. Acknowledge the request with empathy.\n'
'2. Explain briefly and specifically what you can and cannot do.\n'
'3. Offer the closest helpful alternative you can provide.\n'
'4. Point to appropriate resources if relevant.\n\n'
'Example: If asked to prescribe medication:\n'
'Say: "I can explain how this class of medications works and what '
'symptoms they address. For a prescription, you need to see a licensed '
'physician who can evaluate your specific situation. Here is what I can '
'tell you about the medication itself: ..."'
)Le contexte comme variable clé
La même question peut être dangereuse ou inoffensive selon le contexte. La conception des invites doit établir clairement ce contexte afin que le modèle puisse prendre de meilleures décisions de calibrage.
# Context that changes calibration:
# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control
# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
'You are assisting a team of emergency room nurses. '
'Users ask clinical questions during patient care shifts. '
'Provide direct clinical information including dosing thresholds, '
'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)
# The question is identical; the context changes the appropriate response
print('Context determines calibration')Le modèle mental des 1 000 utilisateurs
Un modèle mental utile pour le calibrage consiste à imaginer 1 000 utilisateurs différents envoyant le même message. Quelle est la répartition des intentions ?
- Si 990 utilisateurs sur 1 000 ont une intention inoffensive : le modèle devrait probablement aider
- Si 500 utilisateurs sur 1 000 ont une intention dangereuse : le modèle devrait être prudent
- Si 1 utilisateur sur 1 000 pourrait provoquer un dommage catastrophique : le modèle devrait refuser dans tous les cas
Cette approche probabiliste aide à éviter à la fois le refus excessif (bloquer les 990 utilisateurs) et le refus insuffisant (faciliter les actions des 10 autres).
Éviter le théâtre de la sécurité
Le théâtre de la sécurité désigne des mesures de sécurité qui semblent prudentes, mais qui n'empêchent pas réellement les dommages — tout en dégradant l'expérience des utilisateurs légitimes.
Exemples : ajouter des avertissements à chaque recette (« consultez un nutritionniste avant de manger »), ou refuser de parler d'atrocités historiques dans un contexte éducatif. Ces réponses ne sont pas plus sûres : elles sont simplement inutiles.
# Avoid these patterns in your system prompts:
BAD_SYSTEM_PROMPT = (
'Always add disclaimers to every response. '
'Never discuss anything that could be dangerous. '
'Refuse requests that mention weapons, drugs, or violence in any context. '
'Always recommend consulting a professional for any question.'
# This creates safety theater: unhelpful disclaimers, over-refusal,
# and frustrated users who go elsewhere
)
GOOD_SYSTEM_PROMPT = (
'Provide accurate, helpful information to users. '
'Add safety information when it is directly relevant and actionable. '
'Refuse requests only when providing the information would cause '
'clear, concrete harm that outweighs the benefits to legitimate users. '
'When declining, always explain specifically why and offer alternatives.'
)La friction comme mécanisme de sécurité
Au lieu de refus catégoriques, envisagez la friction : ajoutez une étape qui rend les utilisations dangereuses plus difficiles tout en laissant les utilisations inoffensives fluides. Cette approche est mieux calibrée qu'un choix binaire entre refuser et accepter.
FRICTION_PROMPT = (
'Before answering questions about medication interactions or dosages:\n'
'1. Ask: "Can you tell me a bit about the context — are you a healthcare '
'provider, a patient, or a caregiver?"\n'
'2. Use the answer to calibrate the detail level and framing.\n'
'3. For patient/caregiver context: provide information with appropriate '
'guidance to consult a prescriber for their specific situation.\n'
'4. For healthcare provider context: provide clinical-level detail directly.\n\n'
'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easilyLe test des deux journaux
Le test des deux journaux est une heuristique pour calibrer les refus :
- Journal A (reporter spécialisé dans la sécurité de l'IA) : cette réponse serait-elle présentée comme dangereuse ou irresponsable ?
- Journal B (reporter spécialisé dans la surmédiatisation de l'IA) : ce refus serait-il présenté comme paternaliste, inutile ou absurde ?
Une réponse bien calibrée réussit les deux tests : le journal A ne la présente pas comme dangereuse et le journal B ne la présente pas comme inutilement restrictive.
Tester votre calibrage
Mesurez le calibrage de votre système en constituant un jeu de tests comprenant à la fois :
- Des demandes inoffensives auxquelles il faut répondre (éducatives, professionnelles ou créatives)
- Des demandes dangereuses qu'il faut refuser
Suivez le taux de faux positifs (refus de demandes inoffensives) et le taux de faux négatifs (acceptation de demandes dangereuses). Un système bien réglé présente de faibles taux dans les deux catégories.
Vérification des connaissances : refus excessif
Quelle approche est recommandée lorsqu'un modèle ne peut pas répondre entièrement à une demande pour des raisons de sécurité ?
Récapitulatif : tension entre innocuité et utilité
Le refus excessif est un problème réel et coûteux : les modèles qui refusent trop facilement échouent à aider les utilisateurs légitimes et érodent la confiance. Un refus calibré consiste à ne refuser que lorsque le dommage concret l'emporte clairement sur le bénéfice pour les utilisateurs vraisemblables. Modèles clés : établir le contexte dans les invites système pour aider le modèle à prendre de meilleures décisions, utiliser l'instruction « expliquer pourquoi plutôt que refuser », toujours proposer des solutions utiles et éviter le théâtre de la sécurité (des avertissements partout). Le modèle mental des 1 000 utilisateurs et le test des deux journaux sont des heuristiques pratiques pour trouver le bon équilibre.
Questions Fréquemment Posées
La leçon « Tension entre innocuité et utilité » est-elle gratuite ?
Oui — le texte complet de « Tension entre innocuité et utilité » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Tension entre innocuité et utilité » ?
Gérez le refus excessif grâce à des prompts qui équilibrent sécurité et utilité. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?
Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.
Combien de temps prend la leçon « Tension entre innocuité et utilité » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?
Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Principes de CAI et prompts de critique
- Schémas d’autocritique et de révision
- Tension entre innocuité et utilité
- Implémenter CAI dans des applications