0Pricing
AI Prompt Engineering · Lección

Prompts para describir y subtitular imágenes

Oriente la atención del modelo hacia objetos, relaciones, ambiente y detalles técnicos.

Prompts para describir y subtitular imágenes es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

Modelos de visión y diseño de prompts

Los modelos de lenguaje con visión (VLM), como GPT-4o y Claude, pueden procesar imágenes junto con texto. El prompt que envía con una imagen afecta drásticamente a la calidad, el enfoque y el formato de la descripción del modelo.

Sin un prompt orientativo, el modelo decide qué describir, lo que puede no coincidir con sus necesidades. Un prompt de descripción estructurado indica al modelo exactamente a qué elementos debe prestar atención y cómo organizar su salida.

Envío de una imagen con un prompt

La API de Anthropic acepta imágenes como contenido codificado en base64 o como URL. Esta es la estructura básica:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

El prompt de descripción no estructurado

El prompt más sencillo —Describa esta imagen— produce una salida determinada por completo por las prioridades del modelo. En muchos casos de uso, esto resulta insuficiente:

  • El modelo puede centrarse en el elemento más llamativo visualmente, no en el más relevante
  • La longitud y la organización de las descripciones pueden variar mucho entre imágenes similares
  • A menudo se omiten detalles importantes (texto, objetos pequeños y contexto del fondo)

Los prompts de descripción estructurados resuelven todos estos problemas.

Descripción estructurada: dirigir la atención

Un prompt de descripción estructurado dirige explícitamente la atención del modelo hacia elementos visuales específicos:

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

Control de la longitud de la descripción

Una misma imagen puede necesitar descripciones de distinta longitud según el caso de uso. Controle explícitamente la longitud en el prompt:

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

Prompts de descripción específicos del dominio

Los distintos dominios requieren vocabulario descriptivo y áreas de atención diferentes:

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

Salida estructurada de las descripciones de imágenes

Para los procesos automatizados, solicite una salida JSON estructurada a partir de la descripción de la imagen en lugar de prosa:

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

Descripción centrada en la accesibilidad

Escribir descripciones de imágenes accesibles requiere un estilo de prompt específico que priorice la información para las personas con discapacidad visual:

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

Cómo evitar errores comunes en prompts de descripción

Errores comunes en los prompts de descripción de imágenes y cómo corregirlos:

  • Demasiado vago: Describa la imagen → Solución: especifique qué elementos se deben describir
  • Sin formato: el modelo escribe prosa cuando necesita JSON → Solución: especifique explícitamente el formato de salida
  • Sin límite de longitud: el modelo escribe 1000 palabras → Solución: especifique la longitud objetivo
  • Sin enfoque: todos los elementos se describen por igual → Solución: especifique qué elemento es el principal
  • Sin contexto del dominio: descripción genérica para una imagen especializada → Solución: incluya el vocabulario del dominio y los criterios de atención

Pipeline de descripción de imágenes por lotes

Para procesar varias imágenes en un pipeline automatizado:

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

Pruebas de calidad de prompts de descripción

Pruebe los prompts de descripción con un conjunto diverso de imágenes para garantizar la cobertura y la coherencia:

  • Producto sencillo sobre un fondo blanco
  • Fotografía de estilo de vida con varias personas
  • Documento o letrero con mucho texto
  • Imagen oscura o de baja calidad
  • Contenido abstracto o ambiguo

Para cada imagen de prueba, compruebe que la salida cubra todos los elementos necesarios, respete las restricciones de longitud y use el formato requerido. Ajuste el prompt cuando alguna categoría falle de forma sistemática.

Comprobación rápida

¿Cuál es la principal ventaja de un prompt de descripción de imágenes estructurado frente a un prompt sencillo como «Describa esta imagen»?

Prompts de descripción de imágenes: conclusiones clave

Los prompts estructurados de descripción de imágenes son esenciales para obtener salidas de IA visual coherentes y útiles:

  • Enumere explícitamente los elementos visuales que se deben describir (primer plano, fondo, colores, ambiente, texto y personas)
  • Especifique el formato de salida: prosa, JSON o encabezados de sección concretos
  • Controle explícitamente la longitud y adáptela al caso de uso (un pie de foto de 15 palabras frente a un análisis de 250 palabras)
  • Los prompts específicos del dominio (médico, inmobiliario y de seguridad) requieren vocabulario del dominio y criterios de atención
  • Para la accesibilidad, priorice la información sobre la estética e incluya todo el texto visible literalmente
  • Pruebe con tipos de imágenes diversos: de productos, de estilo de vida, con mucho texto, de baja calidad y abstractas

Preguntas frecuentes

¿La lección «Prompts para describir y subtitular imágenes» es gratis?

Sí — el texto completo de «Prompts para describir y subtitular imágenes» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Prompts para describir y subtitular imágenes»?

Oriente la atención del modelo hacia objetos, relaciones, ambiente y detalles técnicos. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «Prompts para describir y subtitular imágenes»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Prompts para describir y subtitular imágenes
  2. Respuesta a preguntas visuales
  3. Prompts para comparar varias imágenes
  4. Prompts para OCR y análisis de documentos
← Volver a AI Prompt Engineering