0Pricing
AI Prompt Engineering · Leçon

Audio, texte et vision réunis

Coordonner plusieurs entrées.

Audio, texte et vision réunis est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Trois canaux, un contexte

Coordonner l’audio, le texte et la vision consiste à orchestrer trois flux d’entrée au sein d’un contexte cohérent unique. Chaque modalité possède un coût en jetons, un profil de fidélité et un mode d’échec différents — pourtant, le modèle les fusionne dans un même espace d’attention.

  • Audio : temporel, ordonné, avec pertes lors de la compression.
  • Vision : spatiale, soumise à un budget de tuiles, sensible à la perte de détails.
  • Texte : précis et peu coûteux, mais capable de prendre le pas sur les autres.

L’art consiste à les ordonner de façon que chacune renforce les autres au lieu de les noyer.

Des rôles pour les modalités, pas un mélange indistinct

Attribuez à chaque entrée un rôle explicite dans l’instruction. L’ambiguïté concernant le canal faisant autorité produit des réponses incohérentes d’une exécution à l’autre.

  • Vision = vérité de référence pour ce qui est montré.
  • Transcription audio = ce qui est dit à ce sujet.
  • Instruction textuelle = contrat de la tâche et règles de priorité.

Énoncez les rôles dès le début afin que le modèle sache quelle source l’emporte en cas de conflit.

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

Synchronisation de l’audio avec les trames

L’audio et la vision doivent être synchronisés dans le temps, sinon le modèle associe les mauvais mots aux mauvaises images. Fournissez un alignement explicite : horodatez la transcription et les trames, puis laissez le modèle les relier selon le temps.

Sans métadonnées d’alignement, le modèle devine la correspondance — cela convient aux tâches peu précises, mais c’est rédhibitoire pour une analyse synchronisée.

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

Prétranscription ou audio brut

Vous pouvez transmettre de l’audio brut à un modèle audio natif, ou effectuer une prétranscription avec une étape ASR dédiée et transmettre le texte. Les deux approches présentent des compromis.

  • Audio brut : préserve la prosodie, le ton et les paroles superposées — mais consomme davantage de jetons et est plus difficile à ancrer.
  • Prétranscription : peu coûteuse et citable par horodatage, mais elle supprime les indices non lexicaux (sarcasme, urgence).

Choisissez selon la tâche : émotion ou intention → audio brut ; extraction factuelle → transcription.

Ordre de l’entrelacement

L’ordre dans lequel les canaux apparaissent façonne l’attention. Voici une organisation par défaut robuste pour les tâches d’analyse :

  1. Contrat de la tâche et rôles (texte).
  2. Preuves visuelles (trames), chacune étiquetée et horodatée.
  3. Transcription audio, horodatée.
  4. Question précise (texte), faisant référence aux étiquettes et aux horaires.

Placer la question en dernier lui permet de porter son attention sur tout ce qui a déjà été encodé.

Priorisation du budget de jetons

Trois canaux se disputent une seule fenêtre de contexte. La vision domine en matière de coût ; l'audio non compressé arrive en deuxième position. Priorisez avant l'envoi :

  • Échantillonnez les images à la fréquence nécessaire à la tâche, et non chaque image.
  • Recadrez les images sur la zone d'action.
  • Segmentez l'audio en passages pertinents et supprimez les silences.

Consacrez le budget à l'endroit où se trouve la réponse.

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

Corroboration intermodale

Le principal avantage de la formulation de requêtes avec plusieurs entrées est la corroboration : lorsqu'un même fait peut être déduit indépendamment de deux canaux, leur accord constitue une preuve solide et leur désaccord doit vous alerter.

Demandez au modèle de déduire chaque fait essentiel pour chaque canal et de signaler les accords, plutôt que de produire une seule réponse fusionnée qui dissimule la source à laquelle il s'est fié.

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

Gérer les canaux absents ou dégradés

Les entrées réelles se dégradent : un extrait audio étouffé, une image floue, une transcription tronquée. Indiquez au modèle comment procéder avec des preuves partielles, plutôt que de le laisser inventer le canal manquant.

  • « Si l'audio est incompréhensible sur un passage, indiquez [INAUDIBLE]. »
  • « Si une image est trop floue pour être lue, renvoyez NON_LISIBLE pour ce champ. »

Une dégradation maîtrisée vaut mieux qu'une invention silencieuse.

Coréférence des locuteurs et des objets

Les tâches multimodales complexes exigent de relier la personne qui parle (diarisation audio) à la personne qui est visible (vision). Rendez cette coréférence explicite : demandez au modèle d'associer les étiquettes des locuteurs aux personnes visibles dans l'image en utilisant la synchronisation et des indices visibles comme le mouvement des lèvres ou les gestes.

Obligez-le à justifier chaque association par un horodatage et un indice visuel.

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

Sortie : une réponse fusionnée mais traçable

La réponse finale doit être fusionnée pour faciliter la lecture, tout en conservant sa traçabilité par canal sous-jacente. Produisez un objet structuré : la conclusion synthétisée, ainsi que les preuves fournies par chaque modalité avec leur horodatage ou leur cadre.

Les utilisateurs peuvent ainsi accepter le résumé pratique tout en conservant la possibilité de vérifier toute affirmation individuelle en remontant jusqu'à son canal source.

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

Liste de vérification de l'orchestration

Avant tout appel trimodal, vérifiez les points suivants :

  • Les rôles et l'ordre de priorité sont indiqués.
  • Les images et la transcription comportent un horodatage et sont alignées.
  • Les canaux sont priorisés pour respecter le budget.
  • La corroboration et le signalement des désaccords sont demandés.
  • Les jetons de dégradation sont définis (INAUDIBLE, NON_LISIBLE).
  • La sortie est fusionnée, mais ses preuves restent traçables.

Chaque point résout un mode de défaillance précis de la fusion de plusieurs entrées.

Vérification rapide

Vous analysez une vidéo pédagogique et devez déterminer si l'affirmation prononcée par le narrateur correspond à l'action affichée à l'écran à chaque étape.

Récapitulatif : coordonner plusieurs entrées

La formulation de requêtes trimodale réussit lorsque vous attribuez des rôles et un ordre de priorité explicites aux canaux, alignez l'audio et les images par horodatage, priorisez chaque canal pour respecter le budget et demandez une corroboration par canal avec des jetons de dégradation pour les preuves manquantes. Choisissez entre l'audio brut et la prétranscription selon l'importance de la prosodie. Fournissez un résumé fusionné qui permet toujours de remonter de chaque affirmation à un cadre ou à un horodatage : il est pratique à lire et vérifiable.

Questions Fréquemment Posées

La leçon « Audio, texte et vision réunis » est-elle gratuite ?

Oui — le texte complet de « Audio, texte et vision réunis » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Audio, texte et vision réunis » ?

Coordonner plusieurs entrées. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Audio, texte et vision réunis » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Combiner texte et images
  2. Ancrage entre les modalités
  3. Audio, texte et vision réunis
  4. Contrôler les sorties multimodales
← Retour à AI Prompt Engineering