0Pricing
AI Prompt Engineering · Lección

Audio, texto y visión en conjunto

Coordine múltiples entradas.

Audio, texto y visión en conjunto es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

Tres canales, un contexto

Coordinar audio, texto y visión implica orquestar tres flujos de entrada en un único contexto coherente. Cada modalidad tiene un coste de tokens, un perfil de fidelidad y un modo de fallo diferentes; aun así, el modelo las fusiona en un único espacio de atención.

  • Audio: temporal, ordenado y con pérdidas cuando se comprime.
  • Visión: espacial, limitada por el presupuesto de teselas y frágil en cuanto al detalle.
  • Texto: preciso y económico, pero capaz de anular a los demás.

La clave consiste en ordenarlos para que cada uno refuerce a los demás en lugar de eclipsarlos.

Roles de las modalidades, no una mezcla confusa

Asigne a cada entrada un rol explícito en el prompt. La ambigüedad sobre qué canal tiene autoridad produce respuestas incoherentes entre ejecuciones.

  • Visión = verdad fundamental sobre lo que se muestra.
  • Transcripción de audio = lo que se dice al respecto.
  • Instrucción de texto = el contrato de la tarea y las reglas de prioridad.

Declare los roles desde el principio para que el modelo sepa qué fuente prevalece en caso de conflicto.

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

Alineación del audio con los fotogramas

El audio y la visión deben estar alineados temporalmente; de lo contrario, el modelo relacionará las palabras equivocadas con la imagen equivocada. Proporcione una alineación explícita: marque temporalmente la transcripción y los fotogramas, y permita que el modelo los vincule mediante el tiempo.

Sin metadatos de alineación, el modelo adivina la correspondencia; esto puede bastar para tareas imprecisas, pero resulta fatal para el análisis sincronizado.

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

Transcripción previa frente a audio sin procesar

Puede pasar audio sin procesar a un modelo de audio nativo, o realizar una transcripción previa con un paso de ASR específico y pasar el texto. Cada opción tiene sus ventajas y desventajas.

  • Audio sin procesar: conserva la prosodia, el tono y el habla superpuesta, pero consume más tokens y es más difícil de anclar.
  • Transcripción previa: es económica y permite citar marcas de tiempo, pero descarta señales no léxicas (sarcasmo, urgencia).

Elija según la tarea: emoción o intención -> audio sin procesar; extracción factual -> transcripción.

Orden del intercalado

La secuencia en la que aparecen los canales determina la atención. Un orden predeterminado sólido para tareas de análisis es:

  1. Contrato de la tarea y roles (texto).
  2. Evidencia visual (fotogramas), cada uno etiquetado y con marca de tiempo.
  3. Transcripción de audio con marcas de tiempo.
  4. La pregunta concreta (texto), con referencias a las etiquetas y las marcas de tiempo.

Colocar la pregunta al final permite que el modelo atienda a todo lo que ya se ha codificado.

Triaje del presupuesto de tokens

Tres canales compiten por una única ventana de contexto. La visión es la que más coste consume; el audio sin comprimir ocupa el segundo lugar. Haga un triaje antes de enviar:

  • Muestree fotogramas con la frecuencia que requiera la tarea, no todos los fotogramas.
  • Recorte los fotogramas a la región donde ocurre la acción.
  • Segmente el audio en fragmentos relevantes y elimine el silencio.

Asigne el presupuesto allí donde está la respuesta.

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

Corroboración entre modalidades

La mayor ventaja de los prompts con múltiples entradas es la corroboración: cuando el mismo hecho puede deducirse de forma independiente a partir de dos canales, la coincidencia es una evidencia sólida y la discrepancia es una señal de alerta.

Pida al modelo que deduzca cada hecho clave por canal e informe de las coincidencias, en lugar de reducirlo a una única respuesta fusionada que oculte en qué fuente confió.

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

Gestión de canales ausentes o degradados

Las entradas reales se degradan: un clip con el sonido apagado, un fotograma borroso o una transcripción truncada. Indique al modelo cómo proceder con evidencia parcial, en lugar de permitir que invente el contenido del canal ausente.

  • 'Si el audio resulta ininteligible durante un fragmento, márquelo como [INAUDIBLE].'
  • 'Si un fotograma está demasiado borroso para leerlo, devuelva NOT_LEGIBLE para ese campo.'

La degradación controlada es mejor que inventar sin avisar.

Correferencia entre hablantes y objetos

Las tareas multimodales complejas requieren vincular quién habla (diarización de audio) con quién es visible (visión). Haga explícita la correferencia: pida al modelo que asocie las etiquetas de los hablantes con las personas que aparecen en el fotograma usando la sincronización temporal y señales visibles, como el movimiento de los labios o los gestos.

Oblíguelo a justificar cada correspondencia con una marca temporal y una señal visual.

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

Salida: una respuesta fusionada pero trazable

La respuesta final debe estar fusionada para facilitar la lectura, pero conservar por debajo la trazabilidad por canal. Emita un objeto estructurado: la conclusión sintetizada junto con la evidencia de respaldo de cada modalidad, incluida su marca temporal o su cuadro delimitador.

Esto permite que las personas acepten el resumen práctico y, al mismo tiempo, puedan auditar cualquier afirmación individual hasta llegar a su canal de origen.

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

Lista de comprobación de la orquestación

Antes de cualquier llamada trimodal, verifique:

  • Se han indicado los roles y la precedencia.
  • Los fotogramas y la transcripción tienen marcas temporales y están alineados.
  • Los canales se han sometido a triaje para ajustarse al presupuesto.
  • Se han solicitado la corroboración y el señalamiento de discrepancias.
  • Se han definido los tokens de degradación (INAUDIBLE, NOT_LEGIBLE).
  • La salida está fusionada, pero la evidencia es trazable.

Cada elemento cierra un modo de fallo específico de la fusión de múltiples entradas.

Comprobación rápida

Está analizando un vídeo tutorial y necesita saber si la afirmación hablada por el narrador coincide con la acción que aparece en pantalla en cada paso.

Resumen: coordinación de múltiples entradas

Los prompts trimodales funcionan cuando asigna roles y precedencia explícitos a los canales, alinea el audio y los fotogramas mediante marcas temporales, somete cada canal a triaje para ajustarse al presupuesto y solicita corroboración por canal, con tokens de degradación para la evidencia ausente. Decida entre audio sin procesar y pretranscripción según si la prosodia es relevante. Entregue un resumen fusionado que, aun así, permita rastrear cada afirmación hasta un cuadro delimitador o una marca temporal: fácil de leer y posible de auditar.

Preguntas frecuentes

¿La lección «Audio, texto y visión en conjunto» es gratis?

Sí — el texto completo de «Audio, texto y visión en conjunto» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Audio, texto y visión en conjunto»?

Coordine múltiples entradas. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Audio, texto y visión en conjunto»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Combinación de texto e imágenes
  2. Fundamentación entre modalidades
  3. Audio, texto y visión en conjunto
  4. Control de salidas multimodales
← Volver a AI Prompt Engineering