Ancoraggio tra modalità
Fare riferimento alle evidenze visive nel testo.
Ancoraggio tra modalità è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.
Che cosa significa il grounding
Il grounding richiede che ogni affermazione testuale sia riconducibile a un'evidenza specifica in un'altra modalità. Una risposta multimodale priva di grounding è un'ipotesi espressa con fluidità; una risposta con grounding è un'affermazione difendibile, con un riferimento ai pixel (o al fotogramma audio) che la giustificano.
- Il grounding trasforma un output opaco in un output verificabile.
- È la misura singola più efficace contro le allucinazioni visive espresse con sicurezza.
Ordine di ragionamento basato prima sulle evidenze
Forzi il modello a estrarre l'evidenza prima di trarre una conclusione. Se la conclusione viene generata per prima, l'evidenza diventa una razionalizzazione post hoc che si adatta alla risposta, eventualmente errata.
Strutturi la risposta in modo che le regioni osservate vengano prima, l'interpretazione dopo e la risposta finale per ultima.
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.Citazioni di bounding box e regioni
Chieda al modello di produrre coordinate normalizzate approssimative per ogni affermazione visiva. Anche i riquadri imperfetti sono preziosi: un sistema a valle può ritagliare nuovamente la regione e verificarla, mentre un riquadro palesemente errato rivela immediatamente un'allucinazione.
- Utilizzi [x0,y0,x1,y1] normalizzati nell'intervallo 0..1, così la risoluzione diventa irrilevante.
- Consideri i riquadri come suggerimenti di localizzazione, non come rilevamenti precisissimi a livello di pixel.
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)Verifica mediante citazione dei pixel
Per qualsiasi testo visibile nell'immagine, richieda una citazione letterale di ciò che il modello legge. Una citazione letterale è verificabile: è possibile controllarla a campione con l'OCR e il modello ha molte meno probabilità di inventare un valore che deve anche trascrivere esattamente.
Questo vincolo di 'rilettura' è poco costoso e molto più efficace di quanto ci si aspetti per documenti, grafici e insegne.
Controlli di coerenza tra modalità
Quando lo stesso fatto compare in due modalità (un'immagine di una diapositiva e la relativa narrazione parlata), chieda al modello di eseguire un controllo incrociato. L'accordo aumenta l'affidabilità; il disaccordo è a sua volta un segnale che vale la pena rendere visibile.
- 'La didascalia della figura corrisponde a ciò che mostra il grafico?'
- 'La narrazione concorda con il numero visualizzato sullo schermo?'
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)Il rifiuto come esito del grounding
Un sistema con grounding deve poter rispondere 'non visibile'. Senza una via d'uscita esplicita, il modello colma le lacune con invenzioni plausibili. La fornisca e ne premi l'uso.
Istruisca il modello: 'Se l'evidenza non esiste o è illeggibile, restituisca NOT_FOUND anziché tirare a indovinare.' Renda quindi NOT_FOUND un output di prima classe, non penalizzato, nella pipeline.
Ancorare le relazioni spaziali
Le affermazioni relazionali ('la valvola è a sinistra del manometro') sono più difficili da ancorare rispetto alla semplice presenza di un oggetto. Chieda al modello di ancorare entrambi i referenti separatamente tramite riquadri, quindi ricavi la relazione dalle coordinate invece di asserirla direttamente.
Questa scomposizione trasforma un giudizio relazionale fragile in due compiti di localizzazione più semplici, seguiti da un calcolo.
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]Grounding audio e temporale
Il grounding va oltre le immagini. Per l'audio o il video, richieda i timestamp come evidenza: 'citi il punto [mm:ss] in cui è stato detto.' I riferimenti temporali consentono di verificare a campione l'affermazione confrontandola con il segmento sorgente.
- I timestamp ancorano le affermazioni sulla trascrizione e sulla diarizzazione.
- Rendono evidenti i riassunti che si allontanano da ciò che è stato effettivamente detto.
La trappola dell'override testuale
Un'affermazione sicura nel canale testuale può sopprimere l'evidenza visiva corretta: il modello si affida al prior che gli è stato fornito. Se il contesto indica 'il totale della fattura è $400' mentre l'immagine mostra $450, un modello privo di grounding potrebbe ripetere $400.
Contromisura: istruisca il modello a ricavare la risposta esclusivamente dall'immagine, poi a confrontarla con il testo fornito e a segnalare le discrepanze invece di riconciliarle in silenzio.
Verificare il grounding a valle
Il grounding è utile solo se si agisce sulla base di esso. Costruisca un verificatore che elabori l'evidenza strutturata:
- Ritagli nuovamente ogni riquadro ed esegua un nuovo OCR sul testo citato; mancata corrispondenza -> rifiuto.
- Riproduca il timestamp indicato con un secondo passaggio ASR.
- Tratti NOT_FOUND e i flag di conflitto come segnali di instradamento verso la revisione umana.
Il prompt produce l'evidenza; il sistema la fa rispettare.
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9Modello di contratto per il grounding
Un contratto di grounding riutilizzabile riunisce tutte le tecniche:
- Osservazioni prima delle conclusioni.
- Un riquadro e una citazione letterale per ogni affermazione.
- Via d'uscita NOT_FOUND: non tirare mai a indovinare.
- Derivazione basata prima sull'immagine, poi riconciliazione con il testo fornito e segnalazione dei conflitti.
- Timestamp per qualsiasi affermazione audio/video.
Lo codifichi una volta e lo riutilizzi per ogni attività multimodale.
Controllo rapido
I metadati del contesto indicano che il totale dell'ordine è $400, ma sospetta che l'immagine acquisita possa essere diversa.
Riepilogo: grounding tra le modalità
Il grounding rende verificabile l'output multimodale: osservazioni prima delle conclusioni, riquadri e citazioni letterali per ogni affermazione, timestamp per audio e video, una via d'uscita NOT_FOUND e una derivazione basata prima sull'immagine che segnala i conflitti con il testo fornito. Abbini il contratto di grounding a un verificatore a valle che ritagli nuovamente le regioni, rilegga i contenuti e inoltri i flag alla revisione. Evidenza nel prompt, applicazione nel sistema: insieme neutralizzano le allucinazioni espresse con sicurezza.
Domande Frequenti
La lezione «Ancoraggio tra modalità» è gratuita?
Sì — il testo completo di «Ancoraggio tra modalità» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.
Cosa imparerò in «Ancoraggio tra modalità»?
Fare riferimento alle evidenze visive nel testo. Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Prompt Engineering?
Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.
Quanto tempo richiede la lezione «Ancoraggio tra modalità»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?
Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Combinare testo e immagini
- Ancoraggio tra modalità
- Audio, testo e immagini insieme
- Controllo dell'output multimodale