Combinare testo e immagini
Prompt multimodali unificati.
Combinare testo e immagini è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.
Il prompt multimodale unificato
Un prompt multimodale non è testo più un'immagine allegata. È una singola sequenza intercalata in cui i token dell'immagine e quelli testuali occupano lo stesso contesto e interagiscono tramite l'attenzione reciproca. Il modello non «osserva prima l'immagine e poi legge il testo»: elabora un flusso di token unificato.
- Le porzioni dell'immagine vengono proiettate nello stesso spazio degli embedding dei token testuali.
- L'ordine conta: una domanda posta prima di un'immagine attiva un'attenzione diversa rispetto alla stessa domanda posta dopo.
- Sta creando un unico prompt con due forme superficiali, non due prompt.
Ordine di interleaving e ancoraggio
Il punto in cui si colloca l'immagine rispetto all'istruzione modifica il comportamento. Posizionare l'istruzione dopo l'immagine consente al modello di condizionare la domanda su ciò che ha già codificato; posizionarla prima trasforma l'immagine in una prova a supporto di un'attività definita in precedenza.
Per i prompt con più immagini, assegni un'etichetta a ogni immagine direttamente nel prompt, in modo che il testo successivo possa farvi riferimento senza ambiguità ([Image 1], [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]Formulare il compito prima della codifica
Gli encoder visivi sono a perdita: durante il pooling possono scartare i dettagli non pertinenti al compito implicito. Se indica il compito prima dell'immagine, orienta il modello a prestare attenzione alle regioni rilevanti.
- Le richieste di didascalie generiche producono feature generiche.
- Una domanda specifica ('conti i resistori sulla scheda') concentra il budget rappresentazionale sulle sottoregioni pertinenti.
Anticipi la specificità quando serve un livello di dettaglio elevato.
Budget di risoluzione e tiling
La maggior parte dei modelli visivi suddivide le immagini ad alta risoluzione in patch di dimensioni fisse, ciascuna delle quali costa token. Un'immagine 2000x2000 può essere suddivisa in molti tile, ognuno sottocampionato. Il budget dei token è il vincolo silenzioso del prompting multimodale.
- Ritagli la regione di interesse prima di inviarla — non faccia affidamento sul modello per ingrandirla.
- Per i documenti densi, invii ritagli delle pagine invece di un'unica immagine dell'intera pagina.
- Conosca il numero massimo di tile del provider; oltre tale limite, il testo fine diventa illeggibile.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailIl testo come schema strutturato per la visione
Combini l'immagine con uno schema di output esplicito nel canale testuale. L'immagine fornisce il contenuto; il testo fornisce il contratto. Questo è molto più affidabile di una descrizione libera.
Chieda JSON con chiavi corrispondenti alle entità che prevede di vedere e istruisca il modello a emettere null per i campi non visibili: in questo modo riduce i dettagli allucinati.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)Disambiguare con la deissi
I riferimenti deittici ('questo', 'quello a sinistra', 'il riquadro evidenziato') collegano il testo alle regioni dell'immagine. Quando è possibile pre-annotare l'immagine (disegnando un riquadro o aggiungendo una freccia), il riferimento testuale diventa molto più robusto rispetto al solo linguaggio spaziale.
- Le indicazioni spaziali ('in alto a destra') sono soggette a errori dopo una rotazione o un ritaglio.
- Un marcatore numerato sovrapposto insieme a 'oggetto #3' non lascia ambiguità.
- Pre-elaborare l'immagine per aggiungere marcatori è una tecnica legittima di prompt engineering.
Few-shot con modalità miste
È possibile fornire esempi immagine-testo per fissare il formato e lo stile di ragionamento. Ogni esempio è una coppia intercalata (immagine, risposta ideale). Il modello ricava la corrispondenza dalle dimostrazioni.
Mantenga le immagini degli esempi rappresentative della distribuzione reale: un esempio proveniente da un dominio diverso insegna a selezionare le feature sbagliate.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]Ancorare le affermazioni ai pixel
Per le estrazioni ad alta criticità, chieda al modello di citare dove nell'immagine ha origine ogni affermazione. Bounding box approssimative o citazioni del testo presente nell'immagine fungono da evidenza verificabile e riducono drasticamente le invenzioni espresse con sicurezza.
- 'Per ogni valore, riporti il testo esatto dell'etichetta che ha letto.'
- 'Fornisca un riquadro normalizzato approssimativo [x0,y0,x1,y1] per ogni campo.'
Il grounding trasforma una risposta opaca in una risposta verificabile.
Modalità di errore da prevenire
I modelli multimodali falliscono in modi caratteristici:
- Deriva dell'OCR con caratteri piccoli o stilizzati: cifre come 1/7 e 0/O vengono confuse.
- Cedimento nel conteggio oltre circa 6 oggetti simili.
- Bias delle didascalie: il modello descrive la scena tipica invece di quella effettiva.
- Override del canale testuale: un'affermazione testuale errata ma sicura può sopprimere l'evidenza visiva corretta.
Riduca questi rischi chiedendo al modello di ricavare prima la risposta dall'immagine e di confrontarla poi con eventuali asserzioni testuali.
Prompt di riconciliazione
Quando il contesto testuale e l'immagine sono in conflitto, deve stabilire esplicitamente quale fonte abbia la precedenza: non esiste una politica predefinita del modello di cui ci si possa fidare. La dichiari: 'Se l'immagine contraddice i metadati forniti, si fidi dell'immagine e segnali la discrepanza.'
Questa singola frase trasforma un errore silenzioso in un conflitto esplicito e visibile, che la pipeline a valle può indirizzare alla revisione.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)Progettare una pipeline di fusione
Il prompting multimodale in produzione è una pipeline, non una singola chiamata:
- Pre-elaborazione: ritagliare, annotare, ridimensionare per rientrare nel budget.
- Fusione: intercalare i contenuti con un'istruzione che pone il compito al primo posto e con uno schema di output.
- Grounding: richiedere evidenze per ogni affermazione.
- Riconciliazione: stabilire la precedenza tra le modalità.
- Validazione: analizzare il JSON e verificare i valori nulli e i flag di conflitto.
Ogni fase riduce la superficie di errore che il solo prompting non può eliminare.
Controllo rapido
Deve estrarre il testo fine da una scansione ad alta risoluzione di un contratto e ha bisogno di numeri affidabili.
Riepilogo: fusione di testo e immagini
Un prompt multimodale unificato è un unico flusso di token intercalato. Strategie chiave: impostazione con il compito al primo posto per orientare l'encoder visivo, consapevolezza della risoluzione e del tiling tramite il ritaglio, schemi di output espliciti con campi nullable, grounding sui pixel per ogni affermazione e precedenza dichiarata tra le modalità in caso di conflitto. Tratti il tutto come una pipeline — pre-elaborazione, fusione, grounding, riconciliazione, validazione — e gli aspetti fragili del prompting visivo diventano controllabili.
Impara AI Prompt Engineering con un tutor IA — gratis
Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.
- Corsi
- 53
- Lezioni
- 199
Domande Frequenti
La lezione «Combinare testo e immagini» è gratuita?
Sì — il testo completo di «Combinare testo e immagini» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.
Cosa imparerò in «Combinare testo e immagini»?
Prompt multimodali unificati. Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Prompt Engineering?
Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.
Quanto tempo richiede la lezione «Combinare testo e immagini»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?
Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Combinare testo e immagini
- Ancoraggio tra modalità
- Audio, testo e immagini insieme
- Controllo dell'output multimodale