0Pricing
AI Prompt Engineering · Lezione

Cosa sono le guardrail

Controlli di sicurezza e qualità.

Cosa sono le guardrail è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.

Definizione dei guardrail

I guardrail sono controlli programmatici che circondano un LLM per imporre sicurezza, policy e qualità. Vengono eseguiti durante il percorso in ingresso (input dell'utente) e durante il percorso in uscita (output del modello), filtrando ciò che raggiunge il modello e ciò che raggiunge l'utente.

Il modello è probabilistico; i guardrail fanno rispettare in modo deterministico la policy sovrapposta.

Perché il prompting da solo non basta

Le istruzioni nel system prompt come 'non riveli mai i segreti' sono soft: possono essere aggirate dai jailbreak, indebolirsi in contesti lunghi o venire ignorate in caso di distribution shift. I guardrail sono hard perché sono codice esterno al modello, con cui non si può discutere.

Difesa in profondità: istruisca il modello e lo circondi con controlli indipendenti.

Guardrail di input e output

Due posizionamenti con funzioni diverse:

  • I guardrail di input bloccano le prompt injection, le richieste non consentite e i dati PII prima che i token generino costi.
  • I guardrail di output intercettano contenuti non sicuri, dati divulgati, allucinazioni e violazioni dello schema prima della consegna.

I controlli sull'input riducono i costi; quelli sull'output proteggono gli utenti.

Bloccare, oscurare, rigenerare, inoltrare

Un guardrail deve decidere quale azione eseguire quando scatta:

  • Bloccare — rifiuti e restituisca un messaggio sicuro.
  • Oscurare — rimuova la parte incriminata e continui.
  • Rigenerare — invii un nuovo prompt indicando la violazione.
  • Inoltrare — instradi la richiesta a una persona o a un modello più rigido.

L'azione corretta dipende dalla gravità e dalla fiducia dell'utente.

def on_violation(severity):
    if severity == 'critical': return 'block'
    if severity == 'pii': return 'redact'
    if severity == 'quality': return 'regenerate'
    return 'escalate'

Pipeline dei guardrail

Componga i guardrail in una pipeline ordinata; interrompa subito l'elaborazione alla prima violazione grave.

def guarded_generate(user_input):
    for g in INPUT_GUARDS:
        verdict = g.check(user_input)
        if verdict.block:
            return safe_refusal(verdict)
    output = call_model(user_input)
    for g in OUTPUT_GUARDS:
        verdict = g.check(output)
        if verdict.block:
            return verdict.handle(output)
    return output

Controlli deterministici e basati su modello

Due stili di implementazione:

  • Deterministico — regex, schemi, allow-list e deny-list, classificatori con soglie fisse. Veloce, economico, verificabile.
  • Basato su modello — un modello di moderazione o un LLM valutatore analizza policy articolate. Flessibile, ma più lento e a sua volta soggetto a errori.

Utilizzi guardrail deterministici per le regole rigide e guardrail basati su modello per i casi che richiedono valutazione.

Budget di latenza e costi

Ogni guardrail aggiunge latenza. Strategie per mantenere la velocità:

  • Esegua in parallelo i controlli indipendenti sull'output.
  • Ordini i controlli deterministici economici prima di quelli basati su modelli, più costosi.
  • Interrompa l'elaborazione al primo blocco grave.
  • Trasmetta l'output in streaming, ma ne sospenda la consegna finché i guardrail critici non hanno dato esito positivo.
verdicts = await asyncio.gather(*[g.check(out) for g in OUTPUT_GUARDS])
if any(v.block for v in verdicts):
    return handle(verdicts)

I falsi positivi hanno un costo reale

I guardrail troppo aggressivi bloccano richieste legittime e frustrano gli utenti (il 'Non posso aiutarLa' per richieste innocue). Regoli le soglie su un set etichettato e monitori il tasso di falsi positivi come metrica di primo livello, non solo il richiamo sugli attacchi.

Lo streaming complica i controlli sull'output

Se trasmette i token all'utente, una violazione rilevata in ritardo potrebbe essere già sullo schermo. Opzioni:

  • Conservi tutto in un buffer, applichi i controlli e poi rilasci (massima sicurezza, latenza maggiore).
  • Applichi il controllo ai confini delle frasi durante lo streaming.
  • Trasmetta in modo ottimistico, ma ritiri o sostituisca l'output in caso di violazione.

Scelga in base alla gravità di un'eventuale divulgazione parziale.

Auditabilità e logging

I guardrail sono elementi probatori ai fini della conformità. Registri ogni verdetto con hash dell'input, ID del guardrail, gravità e azione intrapresa, prestando attenzione a non registrare il contenuto sensibile. Questo registro dimostra l'applicazione delle policy durante gli audit e consente di ottimizzare il sistema.

audit.log({'guard': g.id, 'verdict': verdict.label,
           'action': verdict.action, 'input_hash': sha256(inp)})

I guardrail non sostituiscono la progettazione

I guardrail riducono il rischio; non lo eliminano. Un modello che non ha accesso a un segreto non può divulgarlo. Preferisca controlli architetturali (privilegio minimo, strumenti con ambito limitato, nessun dato sensibile nel contesto) e usi i guardrail come ultimo livello, non come unico.

Verifica rapida

Quale posizionamento di un guardrail riduce principalmente il consumo di token per le richieste non consentite?

Riepilogo

Fondamenti dei guardrail:

  • Policy deterministica applicata attorno a un modello probabilistico.
  • I guardrail in input riducono i costi; quelli in output proteggono gli utenti.
  • Azioni: bloccare, oscurare, rigenerare, inoltrare.
  • Combini controlli deterministici e basati su modello; li esegua in parallelo.
  • Monitori i falsi positivi; registri i verdetti; preferisca l'architettura alle correzioni successive.

Successivamente: filtraggio di input e output in dettaglio.

Domande Frequenti

La lezione «Cosa sono le guardrail» è gratuita?

Sì — il testo completo di «Cosa sono le guardrail» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.

Cosa imparerò in «Cosa sono le guardrail»?

Controlli di sicurezza e qualità. Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Prompt Engineering?

Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.

Quanto tempo richiede la lezione «Cosa sono le guardrail»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?

Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Cosa sono le guardrail
  2. Filtraggio dell'input e dell'output
  3. Validatori di schemi e regole
  4. Validazione tramite autocritica
← Torna a AI Prompt Engineering