0Pricing
AI Prompt Engineering · درس

مطالبات وصف الصور وإضافة التعليقات التوضيحية

وجّهوا تركيز النموذج إلى العناصر والعلاقات والمزاج والتفاصيل التقنية

مطالبات وصف الصور وإضافة التعليقات التوضيحية درس مجاني في AI Prompt Engineering على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Prompt Engineering، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.

نماذج الرؤية وكتابة المطالبات

يمكن لنماذج اللغة والرؤية (VLMs) مثل GPT-4o وClaude معالجة الصور إلى جانب النصوص. وتؤثر المطالبة التي ترسلها مع الصورة تأثيرًا كبيرًا في جودة وصف النموذج وتركيزه وتنسيقه.

من دون مطالبة توجيهية، يقرر النموذج ما الذي سيصفه — وقد لا يتوافق ذلك مع ما تحتاج إليه. وتوضح مطالبة الوصف المنظَّمة للنموذج العناصر التي ينبغي أن يركز عليها وكيفية تنظيم مخرجاته.

إرسال صورة مع مطالبة

تقبل Anthropic API الصور على هيئة محتوى مشفّر بترميز base64 أو عناوين URL. فيما يلي البنية الأساسية:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

مطالبة الوصف غير المنظَّم

تنتج أبسط مطالبة — صِف هذه الصورة — مخرجاتٍ يحددها النموذج بالكامل وفق أولوياته. ويكون ذلك غير كافٍ في كثير من حالات الاستخدام:

  • قد يركز النموذج على العنصر الأكثر لفتًا للنظر بصريًا، لا على العنصر الأكثر صلة
  • قد تختلف الأوصاف اختلافًا كبيرًا في الطول والتنظيم بين الصور المتشابهة
  • غالبًا ما تُحذف التفاصيل المهمة (النصوص، والعناصر الصغيرة، وسياق الخلفية)

تحل مطالبات الوصف المنظَّمة جميع هذه المشكلات.

الوصف المنظَّم: توجيه الانتباه

توجّه مطالبة الوصف المنظَّمة انتباه النموذج صراحةً إلى عناصر بصرية محددة:

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

التحكم في طول الوصف

قد تحتاج الصورة نفسها إلى أوصاف بأطوال مختلفة لاستخدامات مختلفة. تحكّم في الطول صراحةً ضمن المطالبة:

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

مطالبات الوصف الخاصة بالمجال

تتطلب المجالات المختلفة مفردات وصف ومجالات تركيز مختلفة:

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

المخرجات المنظَّمة من أوصاف الصور

بالنسبة إلى مسارات المعالجة المؤتمتة، اطلب مخرجات JSON منظَّمة من وصف الصورة بدلًا من نص نثري:

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

وصف يركز على إمكانية الوصول

تتطلب كتابة أوصاف الصور لإتاحة الوصول أسلوبًا محددًا في صياغة المطالبة، يعطي الأولوية للمعلومات التي يحتاج إليها المستخدمون من ذوو الإعاقة البصرية:

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

تجنب الأخطاء الشائعة في مطالبات الوصف

الأخطاء الشائعة في مطالبات وصف الصور وطرق إصلاحها:

  • الغموض الشديد: صِف الصورة → الإصلاح: حدّد العناصر التي ينبغي وصفها
  • غياب التنسيق: يكتب النموذج نصًا نثريًا بينما تحتاج إلى JSON → الإصلاح: حدّد تنسيق المخرجات صراحةً
  • غياب حد للطول: يكتب النموذج 1000 كلمة → الإصلاح: حدّد الطول المستهدف
  • غياب التركيز: توصف جميع العناصر بالتساوي → الإصلاح: حدّد العنصر الأساسي
  • غياب سياق المجال: وصف عام لصورة متخصصة → الإصلاح: أدرج مفردات المجال ومعايير التركيز

مسار معالجة دفعي لوصف الصور

لمعالجة صور متعددة ضمن مسار معالجة مؤتمت:

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

اختبار جودة مطالبة الوصف

اختبر مطالبات الوصف على مجموعة متنوعة من الصور لضمان التغطية والاتساق:

  • منتج بسيط على خلفية بيضاء
  • صورة لنمط حياة تضم عدة أشخاص
  • مستند أو لافتة تحتوي على نص كثيف
  • صورة مظلمة أو منخفضة الجودة
  • محتوى تجريدي أو ملتبس

تحقق لكل صورة اختبار من أن المخرجات تغطي جميع العناصر المطلوبة، وتحترم قيود الطول، وتستخدم التنسيق المطلوب. عدّل المطالبة عند فشل أي فئة بشكل منهجي.

تحقق سريع

ما الفائدة الأساسية لمطالبة وصف الصور المنظَّمة مقارنةً بمطالبة بسيطة مثل «صِف هذه الصورة»؟

مطالبات وصف الصور — أهم النقاط

تُعد مطالبات وصف الصور المنظَّمة ضرورية للحصول على مخرجات متسقة ومفيدة من الذكاء الاصطناعي المرئي:

  • اذكر صراحةً العناصر البصرية التي ينبغي وصفها (المقدمة، والخلفية، والألوان، والحالة الشعورية، والنصوص، والأشخاص)
  • حدّد تنسيق المخرجات — نصًا نثريًا أو JSON أو عناوين أقسام محددة
  • تحكّم في الطول صراحةً — ووفّق الطول مع حالة الاستخدام (تعليق من 15 كلمة مقابل تحليل من 250 كلمة)
  • تتطلب المطالبات الخاصة بالمجال (الطب، والعقارات، والأمن) مفردات المجال ومعايير التركيز
  • بالنسبة إلى إمكانية الوصول، أعطِ الأولوية للمعلومات على الجماليات، وأدرج جميع النصوص المرئية حرفيًا
  • اختبر المطالبة على أنواع متنوعة من الصور: المنتجات، ونمط الحياة، والصور الكثيفة بالنصوص، والمنخفضة الجودة، والتجريدية

الأسئلة الشائعة

هل درس «مطالبات وصف الصور وإضافة التعليقات التوضيحية» مجاني؟

نعم — نص درس «مطالبات وصف الصور وإضافة التعليقات التوضيحية» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Prompt Engineering، انتقل إلى CoddyKit PRO. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.

ماذا ستتعلم في «مطالبات وصف الصور وإضافة التعليقات التوضيحية»؟

وجّهوا تركيز النموذج إلى العناصر والعلاقات والمزاج والتفاصيل التقنية تتمرن على AI Prompt Engineering مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ AI Prompt Engineering؟

لا تُشترط خبرة سابقة. AI Prompt Engineering على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.

كم من الوقت يستغرق درس «مطالبات وصف الصور وإضافة التعليقات التوضيحية»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس AI Prompt Engineering هذا؟

نعم. كل درس في AI Prompt Engineering يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. مطالبات وصف الصور وإضافة التعليقات التوضيحية
  2. الإجابة عن الأسئلة المرئية
  3. مطالبات مقارنة صور متعددة
  4. مطالبات OCR وتحليل المستندات
← العودة إلى AI Prompt Engineering