Que sont les garde-fous
Des barrières de sécurité et de qualité.
Que sont les garde-fous est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.
Définition des garde-fous
Les garde-fous sont des vérifications programmatiques placées autour d’un LLM pour faire respecter la sécurité, les règles et la qualité. Ils s’exécutent à l’entrée (entrée utilisateur) et à la sortie (sortie du modèle), afin de contrôler ce qui atteint le modèle et ce qui atteint l’utilisateur.
Le modèle est probabiliste ; les garde-fous sont une application déterministe de règles superposée à ce modèle.
Pourquoi les instructions seules ne suffisent pas
Les instructions du prompt système telles que « ne révélez jamais de secrets » sont souples : elles peuvent être contournées par des attaques de type jailbreak, s’éroder dans les contextes longs ou être ignorées en cas de décalage de distribution. Les garde-fous sont stricts, car ce sont du code extérieur au modèle avec lequel il est impossible de négocier.
Défense en profondeur : donnez des instructions au modèle et entourez-le de vérifications indépendantes.
Garde-fous d’entrée et de sortie
Deux emplacements aux rôles différents :
- Les garde-fous d’entrée bloquent les injections d’instructions, les demandes interdites et les PII avant que les jetons ne coûtent de l’argent.
- Les garde-fous de sortie détectent les contenus dangereux, les données divulguées, les hallucinations et les violations de schéma avant la diffusion.
Les vérifications d’entrée réduisent les coûts ; celles de sortie protègent les utilisateurs.
Bloquer, caviarder, régénérer, transmettre
Un garde-fou doit décider d’une action lorsqu’il se déclenche :
- Bloquer — refuser et renvoyer un message sûr.
- Redact — supprimer le segment problématique et continuer.
- Régénérer — reformuler la demande en signalant la violation.
- Transmettre — orienter vers un humain ou un modèle plus strict.
L’action appropriée dépend de la gravité et de la confiance de l’utilisateur.
def on_violation(severity):
if severity == 'critical': return 'block'
if severity == 'pii': return 'redact'
if severity == 'quality': return 'regenerate'
return 'escalate'La chaîne de traitement des garde-fous
Composez les garde-fous en une chaîne de traitement ordonnée ; arrêtez-vous immédiatement à la première violation stricte.
def guarded_generate(user_input):
for g in INPUT_GUARDS:
verdict = g.check(user_input)
if verdict.block:
return safe_refusal(verdict)
output = call_model(user_input)
for g in OUTPUT_GUARDS:
verdict = g.check(output)
if verdict.block:
return verdict.handle(output)
return outputGarde-fous déterministes ou fondés sur un modèle
Deux styles d’implémentation :
- Déterministe — expressions régulières, schémas, listes d’autorisation ou d’interdiction, classificateurs utilisant des seuils fixes. Rapide, économique et vérifiable.
- Fondé sur un modèle — un modèle de modération ou un LLM juge évalue une règle nuancée. Flexible, mais plus lent et faillible lui aussi.
Utilisez des garde-fous déterministes pour les règles strictes et des garde-fous fondés sur un modèle pour les décisions nécessitant un jugement.
Budgets de latence et de coût
Chaque garde-fou ajoute de la latence. Stratégies pour rester rapide :
- Exécutez les garde-fous de sortie indépendants en parallèle.
- Ordonnez les vérifications déterministes peu coûteuses avant celles, plus coûteuses, effectuées par un modèle.
- Arrêtez-vous dès le premier blocage strict.
- Diffusez la sortie, mais retenez sa livraison jusqu’à la réussite des garde-fous critiques.
verdicts = await asyncio.gather(*[g.check(out) for g in OUTPUT_GUARDS])
if any(v.block for v in verdicts):
return handle(verdicts)Les faux positifs ont un coût réel
Des garde-fous trop agressifs bloquent les demandes légitimes et frustrent les utilisateurs (le « je ne peux pas vous aider » en réponse à des demandes anodines). Ajustez les seuils sur un ensemble annoté et suivez le taux de faux positifs comme une métrique à part entière, et pas seulement le rappel sur les attaques.
La diffusion complique les garde-fous de sortie
Si vous diffusez les jetons à l’utilisateur, une violation détectée tardivement peut déjà être affichée à l’écran. Options :
- Mettez toute la sortie en mémoire tampon, appliquez les garde-fous, puis libérez-la (le plus sûr, mais avec davantage de latence).
- Appliquez les garde-fous aux limites des phrases pendant la diffusion.
- Diffusez de manière optimiste, mais retirez ou remplacez la sortie en cas de violation.
Choisissez selon la gravité potentielle de la diffusion partielle d’une sortie compromise.
Auditabilité et journalisation
Les garde-fous constituent des éléments de conformité. Log chaque verdict avec le hachage de l’entrée, l’identifiant du garde-fou, la gravité et l’action effectuée, tout en veillant à ne pas journaliser le contenu sensible lui-même. Cet enregistrement prouve l’application des règles lors des audits et permet leur ajustement.
audit.log({'guard': g.id, 'verdict': verdict.label,
'action': verdict.action, 'input_hash': sha256(inp)})Les garde-fous ne remplacent pas la conception
Les garde-fous réduisent les risques ; ils ne les éliminent pas. Un modèle qui n’a pas accès à un secret ne peut pas le divulguer. Privilégiez les contrôles architecturaux (moindre privilège, outils à portée limitée, aucune donnée sensible dans le contexte) et utilisez les garde-fous comme dernière couche, pas comme unique protection.
Vérification rapide
Quel emplacement d’un garde-fou réduit principalement la consommation de jetons pour les demandes interdites ?
Récapitulatif
Principes fondamentaux des garde-fous :
- Une règle déterministe superposée à un modèle probabiliste.
- Les garde-fous d’entrée réduisent les coûts ; ceux de sortie protègent les utilisateurs.
- Actions : bloquer, caviarder, régénérer, transmettre.
- Combinez des vérifications déterministes et fondées sur un modèle ; exécutez-les en parallèle.
- Suivez les faux positifs, consignez les verdicts et privilégiez l’architecture aux corrections superficielles.
Ensuite : filtrage des entrées et des sorties en profondeur.
Questions Fréquemment Posées
La leçon « Que sont les garde-fous » est-elle gratuite ?
Oui — le texte complet de « Que sont les garde-fous » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Que sont les garde-fous » ?
Des barrières de sécurité et de qualité. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?
Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.
Combien de temps prend la leçon « Que sont les garde-fous » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?
Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Que sont les garde-fous
- Filtrage des entrées et des sorties
- Validateurs de schémas et de règles
- Validation par autocritique