AI Prompt Engineering · Lección

Fundamentación entre modalidades

Haga referencia a evidencias visuales en el texto.

Lección 2 de 413 pasos

Fundamentación entre modalidades es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

Qué significa el anclaje

El anclaje es el requisito de que toda afirmación textual pueda rastrearse hasta evidencia específica de otra modalidad. Una respuesta multimodal sin anclaje es una conjetura fluida; una respuesta anclada es una afirmación defendible con una referencia a los píxeles (o al fotograma de audio) que la justifican.

  • El anclaje convierte una salida opaca en una salida auditable.
  • Es la medida individual más eficaz contra las alucinaciones visuales expresadas con confianza.

Orden de razonamiento basado primero en la evidencia

Obligue al modelo a extraer la evidencia antes de sacar conclusiones. Si genera primero la conclusión, la «evidencia» se convierte en una justificación posterior que coincide con la respuesta, posiblemente incorrecta.

Estructure la respuesta de modo que las regiones observadas aparezcan primero, la interpretación después y la respuesta final al final.

schema = {
  'observations': '[{region: str, text_read: str}]',
  'inference': 'str — reasoning over observations only',
  'answer': 'str'
}
# Order in the prompt enforces order in generation.

Citas de cuadros delimitadores y regiones

Pida al modelo que emita coordenadas normalizadas aproximadas para cada afirmación visual. Incluso los cuadros imperfectos son valiosos: un sistema posterior puede recortar y volver a verificar, y un cuadro claramente erróneo deja al descubierto una alucinación de inmediato.

  • Use [x0,y0,x1,y1] normalizado en 0..1 para que la resolución sea irrelevante.
  • Trate los cuadros como pistas de localización, no como detecciones con precisión de píxel.
instruction = (
  'For each extracted field, return '
  '{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
  'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)

Verificación mediante citas literales de los píxeles

Para cualquier texto visible en la imagen, exija una cita literal de lo que lee el modelo. Una cita literal se puede comprobar: puede verificarla mediante OCR por muestreo, y es mucho menos probable que el modelo invente un valor que también debe transcribir exactamente.

Esta restricción de «leerlo de nuevo» es económica y resulta desproporcionadamente eficaz para documentos, gráficos y carteles.

Comprobaciones de coherencia entre modalidades

Cuando el mismo hecho aparece en dos modalidades (la imagen de una diapositiva y su narración hablada), indique al modelo que las verifique de forma cruzada. La coincidencia aumenta la confianza; la discrepancia es, por sí misma, una señal que merece hacerse visible.

  • «¿El pie de la figura coincide con lo que muestra el gráfico?»
  • «¿La narración coincide con el número que aparece en pantalla?»
prompt = (
  'You have a slide image and its transcript. '
  'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
  'Flag any disagreement explicitly.'
)

La negativa como resultado del anclaje

Un sistema anclado debe poder responder «no visible». Sin una vía de escape explícita, el modelo rellena los vacíos con invenciones plausibles. Proporciónela y recompénsela.

Indique: «Si la evidencia no existe o es ilegible, devuelva NOT_FOUND en lugar de adivinar». Después, convierta NOT_FOUND en un resultado de primera clase, sin penalización, dentro de su pipeline.

Anclaje de relaciones espaciales

Las afirmaciones relacionales («la válvula está a la izquierda del manómetro») son más difíciles de anclar que la presencia de un objeto. Pida al modelo que ancle ambos referentes de forma independiente mediante cuadros y, después, derive la relación a partir de las coordenadas en lugar de afirmarla directamente.

Esta descomposición convierte un juicio relacional frágil en dos tareas de localización más sencillas y una operación aritmética.

# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
    return a['box'][2] < b['box'][0]

Anclaje de audio y temporal

El anclaje va más allá de las imágenes. Para audio o vídeo, exija marcas de tiempo como evidencia: «cite el [mm:ss] en el que se dijo esto». Las referencias temporales permiten verificar la afirmación frente al segmento de origen.

  • Las marcas de tiempo anclan las afirmaciones de transcripción y diarización.
  • Dejan al descubierto los resúmenes que se alejan de lo que realmente se dijo.

La trampa de la anulación por el texto

Una afirmación expresada con confianza en el canal de texto puede suprimir la evidencia visual correcta: el modelo se atiene a la información previa que usted le proporcionó. Si su contexto indica «el total de la factura es $400» y la imagen muestra $450, un modelo sin anclaje puede repetir $400.

Defensa: indique al modelo que deduzca primero exclusivamente a partir de la imagen, después la compare con el texto proporcionado y señale las discrepancias en lugar de reconciliarlas en silencio.

Verificación posterior del anclaje

El anclaje solo resulta útil si actúa en consecuencia. Cree un verificador que consuma la evidencia estructurada:

  • Vuelva a recortar cada cuadro y a ejecutar el OCR sobre el texto citado; si no coincide -> rechace.
  • Reproduzca la marca de tiempo citada mediante una segunda pasada de ASR.
  • Trate NOT_FOUND y las marcas de conflicto como señales para derivar el caso a revisión humana.

El prompt produce la evidencia; su sistema hace que se cumpla.

def verify(field):
    crop = image.crop(field['box'])
    read = ocr(crop)
    return similar(read, field['value']) > 0.9

Plantilla de contrato de anclaje

Un contrato de anclaje reutilizable reúne todas las técnicas:

  • Observaciones antes de conclusiones.
  • Cuadro y cita literal para cada afirmación.
  • Vía de escape NOT_FOUND; nunca adivine.
  • Derivación basada primero en la imagen; después, reconciliación con el texto proporcionado y señalización de conflictos.
  • Marcas de tiempo para cualquier afirmación de audio o vídeo.

Codifíquelo una vez y reutilícelo en todas las tareas multimodales.

Comprobación rápida

Los metadatos de contexto indican que el total del pedido es $400, pero sospecha que la imagen escaneada puede mostrar otra cantidad.

Resumen: anclaje entre modalidades

El anclaje hace que las salidas multimodales sean auditables: observaciones antes de conclusiones, cuadros y citas literales para cada afirmación, marcas de tiempo para audio y vídeo, una vía de escape NOT_FOUND y una derivación basada primero en la imagen que señale los conflictos con el texto proporcionado. Combine el contrato de anclaje con un verificador posterior que vuelva a recortar, vuelva a leer y derive las marcas a revisión. Evidencia en el prompt y cumplimiento en el sistema: juntos neutralizan las alucinaciones expresadas con confianza.

Gratis para empezar

Aprende AI Prompt Engineering con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
53
Lecciones
199

Preguntas frecuentes

¿La lección «Fundamentación entre modalidades» es gratis?

Sí — el texto completo de «Fundamentación entre modalidades» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Fundamentación entre modalidades»?

Haga referencia a evidencias visuales en el texto. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Fundamentación entre modalidades»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Combinación de texto e imágenes
  2. Fundamentación entre modalidades
  3. Audio, texto y visión en conjunto
  4. Control de salidas multimodales
← Volver a AI Prompt Engineering