AI Prompt Engineering · Lezione

Audio, testo e immagini insieme

Coordinare più input.

Lezione 3 di 413 passaggi

Audio, testo e immagini insieme è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.

Tre canali, un unico contesto

Coordinare audio, testo e visione significa orchestrare tre flussi di input in un unico contesto coerente. Ogni modalità ha un costo in token, un profilo di fedeltà e una modalità di errore diversi — eppure il modello li fonde in un unico spazio di attenzione.

  • Audio: temporale, ordinato, con perdita in caso di compressione.
  • Visione: spaziale, vincolata dal budget dei tile, fragile nei dettagli.
  • Testo: preciso, economico, ma capace di sovrascrivere le altre modalità.

L'arte consiste nel disporle in sequenza in modo che ciascuna rafforzi le altre invece di sommergerle.

Ruoli delle modalità, non un miscuglio indistinto

Assegni a ogni input un ruolo esplicito nel prompt. L'ambiguità su quale canale sia autorevole produce risposte incoerenti tra un'esecuzione e l'altra.

  • Visione = verità di riferimento per ciò che viene mostrato.
  • Trascrizione audio = ciò che viene detto al riguardo.
  • Istruzione testuale = contratto del compito e regole di precedenza.

Dichiari i ruoli in anticipo, così il modello sa quale fonte prevale in caso di conflitto.

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

Allineare l'audio ai fotogrammi

Audio e visione devono essere allineati temporalmente, altrimenti il modello correla le parole sbagliate con l'immagine sbagliata. Fornisca un allineamento esplicito: apponga i timestamp alla trascrizione e ai fotogrammi, poi lasci che il modello li associ in base al tempo.

Senza metadati di allineamento, il modello deve indovinare la corrispondenza: va bene per i compiti generici, ma è disastroso per l'analisi sincronizzata.

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

Pre-trascrizione o audio grezzo

È possibile passare l'audio grezzo a un modello audio nativo oppure pre-trascriverlo con un passaggio ASR dedicato e passare il testo. Entrambe le opzioni presentano dei compromessi.

  • Audio grezzo: conserva prosodia, tono e sovrapposizione vocale, ma richiede più token ed è più difficile da ancorare.
  • Pre-trascritto: economico e citabile tramite timestamp, ma elimina i segnali non lessicali (sarcasmo, urgenza).

Scelga in base al compito: emozione/intento -> audio grezzo; estrazione fattuale -> trascrizione.

Ordinare l'interleaving

La sequenza con cui compaiono i canali orienta l'attenzione. Un'impostazione predefinita solida per i compiti di analisi:

  1. Contratto del compito e ruoli (testo).
  2. Evidenza visiva (fotogrammi), ciascuno con etichetta e timestamp.
  3. Trascrizione audio, con timestamp.
  4. Domanda specifica (testo), con riferimenti a etichette e tempi.

Mettere la domanda per ultima le permette di orientare l'attenzione su tutto ciò che è già stato codificato.

Triage del budget dei token

Tre canali competono per un'unica finestra di contesto. La visione è la componente più costosa; l'audio non compresso viene subito dopo. Esegua il triage prima dell'invio:

  • Campioni i fotogrammi alla frequenza necessaria per il compito, non tutti i fotogrammi.
  • Ritagli i fotogrammi in modo da includere la regione dell'azione.
  • Segmenti l'audio negli intervalli pertinenti ed elimini il silenzio.

Investa il budget dove si trova la risposta.

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

Corroborazione multimodale

Il vantaggio maggiore del prompting multi-input è la corroborazione: quando lo stesso fatto può essere ricavato indipendentemente da due canali, la concordanza costituisce una forte evidenza e la discordanza è un campanello d'allarme.

Chieda al modello di ricavare ogni fatto chiave per ciascun canale e di segnalare la concordanza, anziché ridurre tutto a un'unica risposta fusa che nasconde a quale fonte abbia dato fiducia.

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

Gestire i canali mancanti o degradati

Gli input reali si degradano: una clip ovattata, un fotogramma sfocato, una trascrizione troncata. Indichi al modello come procedere con evidenze parziali, invece di permettergli di inventare il canale mancante.

  • 'Se l'audio è incomprensibile in un intervallo, lo contrassegni come [INAUDIBLE].'
  • 'Se un fotogramma è troppo sfocato per poter essere letto, restituisca NOT_LEGIBLE per quel campo.'

La degradazione controllata è preferibile all'invenzione silenziosa.

Coreferenza tra parlante e oggetto

Le attività multimodali complesse richiedono di collegare chi parla (diarizzazione audio) a chi è visibile (visione). Renda esplicita la coreferenza: chieda al modello di associare le etichette dei parlanti alle persone presenti nel fotogramma, usando la temporizzazione e indizi visibili come il movimento delle labbra o i gesti.

Lo obblighi a giustificare ogni associazione con un timestamp e un indizio visivo.

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

Output: una risposta unificata ma tracciabile

La risposta finale dovrebbe essere unificata per facilitarne la lettura, mantenendo però al suo interno la tracciabilità per canale. Emetta un oggetto strutturato: la conclusione sintetizzata più le evidenze a supporto provenienti da ogni modalità, con il relativo timestamp o riquadro.

In questo modo le persone possono accettare il riepilogo comodo, pur potendo verificare ogni singola affermazione risalendo al relativo canale di origine.

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

Checklist di orchestrazione

Prima di qualsiasi chiamata trimodale, verifichi:

  • Ruoli e precedenza specificati.
  • Fotogrammi e trascrizione con timestamp e allineati.
  • Canali sottoposti a triage per rientrare nel budget.
  • Richiesta di corroborazione e segnalazione delle discordanze.
  • Token di degradazione definiti (INAUDIBLE, NOT_LEGIBLE).
  • Output unificato ma con evidenze tracciabili.

Ogni elemento chiude una specifica modalità di errore della fusione multi-input.

Verifica rapida

Sta analizzando un video tutorial e deve stabilire se l'affermazione pronunciata dal narratore corrisponde all'azione mostrata sullo schermo in ogni passaggio.

Riepilogo: coordinare più input

Il prompting trimodale riesce quando assegna ruoli e precedenze espliciti ai canali, allinea audio e fotogrammi tramite timestamp, sottopone ogni canale a triage per rientrare nel budget e richiede la corroborazione per canale, con token di degradazione per le evidenze mancanti. Scelga audio grezzo o pre-trascrizione in base all'importanza della prosodia. Fornisca un riepilogo unificato che consenta comunque di ricondurre ogni affermazione a un riquadro o a un timestamp: comodo da leggere e verificabile.

Gratis per iniziare

Impara AI Prompt Engineering con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
53
Lezioni
199

Domande Frequenti

La lezione «Audio, testo e immagini insieme» è gratuita?

Sì — il testo completo di «Audio, testo e immagini insieme» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.

Cosa imparerò in «Audio, testo e immagini insieme»?

Coordinare più input. Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Prompt Engineering?

Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Audio, testo e immagini insieme»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?

Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Combinare testo e immagini
  2. Ancoraggio tra modalità
  3. Audio, testo e immagini insieme
  4. Controllo dell'output multimodale
← Torna a AI Prompt Engineering