Combinación de texto e imágenes
Cree prompts multimodales unificados.
Combinación de texto e imágenes es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.
El prompt multimodal unificado
Un prompt multimodal no es texto más una imagen adjunta. Es una secuencia única intercalada en la que los tokens de imagen y los tokens de texto ocupan el mismo contexto y atienden unos a otros. El modelo no «mira la imagen y luego lee el texto», sino que procesa un flujo de tokens fusionado.
- Los parches de imagen se proyectan en el mismo espacio de embeddings que los tokens de texto.
- El orden importa: una pregunta colocada antes de una imagen activa una atención distinta de la que activa una pregunta colocada después.
- Está creando un solo prompt con dos formas de superficie, no dos prompts.
Orden de intercalado y anclaje
El lugar donde coloca la imagen con respecto a la instrucción cambia el comportamiento. Colocar la instrucción después de la imagen permite que el modelo condicione la pregunta a lo que ya ha codificado; colocarla antes convierte la imagen en evidencia para una tarea planteada de antemano.
En los prompts con varias imágenes, etiquete cada imagen en línea para que el texto posterior pueda referirse a ella sin ambigüedad ([Image 1], [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]Definición de la tarea antes de la codificación
Los codificadores de visión tienen pérdidas: durante el pooling pueden descartar los detalles que no sean relevantes para la tarea implícita. Si especifica la tarea antes de la imagen, orienta al modelo a prestar atención a las regiones importantes.
- Las solicitudes de descripciones genéricas producen características genéricas.
- Una pregunta específica («cuente las resistencias de la placa») concentra el presupuesto representacional en las subregiones relevantes.
Dé prioridad a la especificidad cuando necesite detalles precisos.
Presupuestos de resolución y teselado
La mayoría de los modelos de visión dividen las imágenes de alta resolución en parches de tamaño fijo, y cada uno consume tokens. Una imagen de 2000x2000 puede dividirse en muchas teselas, cada una submuestreada. El presupuesto de tokens es la restricción silenciosa de los prompts multimodales.
- Recorte la región de interés antes de enviarla; no confíe en que el modelo haga zoom.
- Para documentos densos, envíe recortes de cada página en lugar de una sola imagen de página completa.
- Conozca el número máximo de teselas de su proveedor; por encima de ese límite, el texto pequeño se vuelve ilegible.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailEl texto como esquema estructurado para la visión
Combine la imagen con un esquema de salida explícito en el canal de texto. La imagen proporciona el contenido; el texto proporciona el contrato. Esto es mucho más fiable que una descripción de formato libre.
Solicite JSON con claves correspondientes a las entidades que espera encontrar e indique al modelo que emita null para los campos que no sean visibles; así se suprimen los detalles alucinados.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)Desambiguación mediante deixis
Las referencias deícticas («esto», «el de la izquierda», «el recuadro resaltado») vinculan el texto con regiones de la imagen. Cuando pueda anotar previamente la imagen (dibujar un recuadro o añadir una flecha), la referencia textual resulta mucho más sólida que el uso exclusivo del lenguaje espacial.
- Las expresiones espaciales («arriba a la derecha») son propensas a errores cuando hay rotación o recortes.
- Una marca numerada superpuesta junto con «objeto n.º 3» no deja lugar a dudas.
- Preprocesar la imagen para añadir marcas es una técnica legítima de ingeniería de prompts.
Ejemplos few-shot con modalidades mixtas
Puede proporcionar ejemplos de imagen a texto para fijar el formato y el estilo de razonamiento. Cada ejemplo es un par intercalado (imagen, respuesta ideal). El modelo infiere la correspondencia a partir de las demostraciones.
Mantenga las imágenes de ejemplo representativas de la distribución real; un ejemplo de otro dominio enseña una selección de características incorrecta.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]Anclaje de afirmaciones a píxeles
Para extracciones de alta criticidad, exija al modelo que indique dónde se origina en la imagen cada afirmación. Los cuadros delimitadores aproximados o el texto citado de la imagen actúan como evidencia verificable y reducen drásticamente las invenciones expresadas con confianza.
- «Para cada valor, cite el texto exacto de la etiqueta que ha leído».
- «Proporcione un cuadro normalizado aproximado [x0,y0,x1,y1] para cada campo».
El anclaje convierte una respuesta opaca en una respuesta auditable.
Modos de fallo que debe evitar
Los modelos multimodales fallan de formas características:
- Deriva del OCR en fuentes pequeñas o estilizadas: confunden dígitos como 1/7 y 0/O.
- Colapso del conteo cuando hay más de unos 6 objetos similares.
- Sesgo de descripción: describen la escena típica en lugar de la escena real.
- Anulación por el canal de texto: una afirmación textual errónea expresada con confianza puede suprimir la evidencia visual correcta.
Mitíguelo pidiendo al modelo que deduzca primero a partir de la imagen y después reconcilie el resultado con las afirmaciones textuales.
Instrucciones de reconciliación
Cuando el contexto textual y la imagen entren en conflicto, debe decidir explícitamente qué tiene prioridad; no puede confiar en que el modelo tenga una política predeterminada. Establézcalo: «Si la imagen contradice los metadatos proporcionados, confíe en la imagen e indique la discrepancia».
Esta única frase convierte un error silencioso en un conflicto explícito y visible que su pipeline posterior puede derivar a revisión.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)Diseño de un pipeline de fusión
Los prompts multimodales de producción son un pipeline, no una sola llamada:
- Preprocesar: recortar, anotar y reducir la escala para ajustarse al presupuesto.
- Fusionar: intercalar los elementos con una instrucción que priorice la tarea y un esquema de salida.
- Anclar: exigir evidencia para cada afirmación.
- Reconciliar: establecer la prioridad entre modalidades.
- Validar: analizar el JSON y comprobar los valores null y las marcas de conflicto.
Cada etapa reduce la superficie de fallos que el prompting por sí solo no puede reducir.
Comprobación rápida
Debe extraer la letra pequeña de un escaneo de contrato de alta resolución y necesita números fiables.
Resumen: fusión de texto e imágenes
Un prompt multimodal unificado es una única secuencia intercalada de tokens. Movimientos clave: definición de la tarea en primer lugar para orientar el codificador de visión, conocimiento de la resolución y el teselado mediante recortes, esquemas de salida explícitos con campos anulables, anclaje a píxeles para cada afirmación y prioridad declarada entre modalidades para resolver conflictos. Trátelo como un pipeline —preprocesar, fusionar, anclar, reconciliar y validar— y las partes frágiles del prompting visual pasarán a ser controlables.
Preguntas frecuentes
¿La lección «Combinación de texto e imágenes» es gratis?
Sí — el texto completo de «Combinación de texto e imágenes» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.
¿Qué aprenderé en «Combinación de texto e imágenes»?
Cree prompts multimodales unificados. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Prompt Engineering?
No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.
¿Cuánto tiempo toma la lección «Combinación de texto e imágenes»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?
Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Combinación de texto e imágenes
- Fundamentación entre modalidades
- Audio, texto y visión en conjunto
- Control de salidas multimodales