دمج النصوص والصور
تلقينات موحّدة متعددة الوسائط.
دمج النصوص والصور درس مجاني في AI Prompt Engineering على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Prompt Engineering، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
الموجّه الموحّد متعدد الوسائط
الموجّه متعدد الوسائط ليس نصًا مع صورة مرفقة. بل هو تسلسل واحد متداخل تشغل فيه رموز الصور ورموز النص السياق نفسه، وينتبه بعضها إلى بعض. لا «ينظر» النموذج إلى الصورة ثم «يقرأ» النص، بل يعالج تدفقًا موحّدًا من الرموز.
- تُسقَط رقع الصور في مساحة التضمين نفسها التي تشغلها رموز النص.
- الترتيب مهم: فالسؤال الموضوع قبل الصورة يهيّئ انتباهًا مختلفًا عن السؤال الموضوع بعد الصورة.
- أنتم تكتبون موجّهًا واحدًا ذا شكلين سطحيين، لا موجّهين اثنين.
ترتيب التداخل والتثبيت
يغيّر موضع الصورة بالنسبة إلى التعليمات سلوك النموذج. فوضع التعليمات بعد الصورة يتيح للنموذج تكييف السؤال استنادًا إلى ما سبق أن شفّره؛ أما وضعها قبل الصورة فيحوّل الصورة إلى دليل لمهمة محددة مسبقًا.
في الموجّهات متعددة الصور، سمّوا كل صورة داخل النص حتى يتمكن النص اللاحق من الإشارة إليها دون لبس ([Image 1]، [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]تأطير المهمة قبل الترميز
مُرمِّزات الرؤية فاقدة للمعلومات: إذ يمكن التخلص أثناء التجميع من التفاصيل غير المرتبطة بالمهمة الضمنية. إذا صرّحتم بالمهمة قبل الصورة، فإنكم توجّهون النموذج إلى التركيز على المناطق المهمة.
- تؤدي طلبات إنشاء أوصاف عامة إلى ميزات عامة.
- يركّز سؤال محدد («عدّ المقاومات الموجودة على اللوحة») الميزانية التمثيلية على المناطق الفرعية ذات الصلة.
قدّموا تفاصيل المهمة مبكرًا عندما تكون هناك حاجة إلى تفاصيل دقيقة.
ميزانيات الدقة والتقسيم إلى مربعات
تُقسّم معظم نماذج الرؤية الصورَ عالية الدقة إلى رقع ثابتة الحجم، تستهلك كل منها عددًا من الرموز. قد تُقسّم صورة بحجم 2000x2000 إلى العديد من المربعات، مع تصغير كل منها. ميزانية الرموز هي القيد الخفي في توجيه النماذج متعددة الوسائط.
- اقصِ المنطقة محل الاهتمام قبل الإرسال — ولا تعتمد على النموذج لتكبيرها.
- بالنسبة إلى المستندات الكثيفة، أرسل صورًا مقتصة للصفحات بدلًا من صورة واحدة للصفحة كاملة.
- اعرف الحد الأقصى للمربعات لدى مزوّد الخدمة؛ فتجاوزه يجعل النص الدقيق غير قابل للقراءة.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailالنص كمخطط مُهيكل للرؤية
اجمعوا الصورة مع مخطط إخراج صريح في قناة النص. توفّر الصورة المحتوى، بينما يوفّر النص العقد. وهذا أكثر موثوقية بكثير من الوصف الحر.
اطلبوا JSON بمفاتيح تمثل الكيانات التي تتوقعون رؤيتها، ووجّهوا النموذج إلى إخراج null للحقول غير المرئية — فهذا يحدّ من التفاصيل المختلقة.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)إزالة الالتباس باستخدام الإشاريات
تربط الإشارات الإشارية («هذا»، «الموجود على اليسار»، «المربع المميز») النص بمناطق في الصورة. وعندما يمكنكم إضافة علامات مسبقة إلى الصورة (رسم مربع أو إضافة سهم)، تصبح الإشارة النصية أكثر متانة بكثير من الاعتماد على اللغة المكانية وحدها.
- الكلمات المكانية («أعلى اليمين») عرضة للأخطاء عند تدوير الصورة أو قصّها.
- إن إضافة مؤشر مرقّم فوق الصورة مع عبارة «الكائن رقم 3» تزيل الالتباس.
- تُعد معالجة الصورة مسبقًا لإضافة المؤشرات أسلوبًا مشروعًا في هندسة التوجيه.
التعلّم بعدد قليل من الأمثلة مع وسائط مختلطة
يمكنكم تقديم أمثلة توضيحية لتحويل الصورة إلى نص لتثبيت التنسيق وأسلوب الاستدلال. كل مثال هو زوج متداخل من (صورة، إجابة مثالية). يستنتج النموذج العلاقة من الأمثلة التوضيحية.
احرصوا على أن تكون صور الأمثلة التوضيحية ممثلة للتوزيع الفعلي — فالمثال القادم من مجال مختلف يعلّم النموذج اختيار الميزات الخاطئ.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]إسناد الادعاءات إلى وحدات البكسل
عند الاستخراج عالي الأهمية، اطلبوا من النموذج تحديد موضع نشوء كل ادعاء في الصورة. تعمل المربعات المحيطة التقريبية أو النص المنقول من الصورة كأدلة قابلة للتحقق، وتحدّ بدرجة كبيرة من الاختلاق الواثق.
- «لكل قيمة، انقل نص التسمية الدقيق الذي قرأته.»
- «قدّم مربعًا تقريبيًا مُطبّعًا [x0,y0,x1,y1] لكل حقل.»
يحوّل الإسناد الإجابة المعتمة إلى إجابة قابلة للتدقيق.
أنماط الفشل التي ينبغي الحذر منها
تفشل النماذج متعددة الوسائط بطرق مميزة:
- انحراف OCR مع الخطوط الصغيرة أو المزخرفة — إذ قد تختلط أرقام مثل 1/7 و0/O.
- انهيار العدّ عند تجاوز نحو 6 كائنات متشابهة.
- انحياز الوصف: وصف المشهد المعتاد بدلًا من المشهد الفعلي.
- تجاوز قناة النص: قد يؤدي ادعاء نصي خاطئ وواثق إلى حجب الدليل البصري الصحيح.
خفّفوا هذه المشكلات بأن تطلبوا من النموذج الاستنتاج من الصورة أولًا، ثم التوفيق بينها وبين أي تأكيدات نصية.
توجيهات التوفيق بين المصادر
عندما يتعارض سياق النص مع الصورة، يجب أن تحددوا صراحةً أيهما له الأولوية — فلا توجد لدى النموذج سياسة افتراضية يمكن الوثوق بها. اذكروها بوضوح: «إذا ناقضت الصورة البيانات الوصفية المقدمة، فثِقوا بالصورة وأشيروا إلى التباين.»
تحوّل هذه الجملة الواحدة الخطأ الصامت إلى تعارض صريح ظاهر يمكن لخط أنابيبكم اللاحق توجيهه للمراجعة.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)تصميم خط أنابيب لدمج الوسائط
توجيه النماذج متعددة الوسائط في بيئة الإنتاج هو خط أنابيب، وليس استدعاءً واحدًا:
- المعالجة المسبقة: القص، وإضافة العلامات، والتصغير بما يتوافق مع الميزانية.
- الدمج: التداخل مع تعليمة تضع المهمة أولًا ومخطط إخراج.
- الإسناد: طلب دليل لكل ادعاء.
- التوفيق: تحديد الأولوية بين الوسائط.
- التحقق: تحليل JSON، وفحص القيم الخالية وعلامات التعارض.
تقلّص كل مرحلة مساحة الفشل التي لا يستطيع التوجيه وحده القضاء عليها.
تحقق سريع
يجب عليكم استخراج النص الدقيق من مسح ضوئي عالي الدقة لعقد، وتحتاجون إلى أرقام موثوقة.
مراجعة: دمج النصوص والصور
التوجيه متعدد الوسائط الموحّد هو تدفق واحد متداخل من الرموز. وتشمل الخطوات الأساسية: تأطير المهمة أولًا لتوجيه مُرمِّز الرؤية، والوعي بالدقة والتقسيم إلى مربعات عبر القص، ومخططات الإخراج الصريحة ذات الحقول القابلة للقيم الخالية، وإسناد كل ادعاء إلى وحدات البكسل، وتحديد أولوية الوسائط عند التعارض. تعاملوا معه بوصفه خط أنابيب — معالجة مسبقة، ودمج، وإسناد، وتوفيق، وتحقق — وعندها تصبح الأجزاء الهشة في توجيه الرؤية قابلة للتحكم.
الأسئلة الشائعة
هل درس «دمج النصوص والصور» مجاني؟
نعم — نص درس «دمج النصوص والصور» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Prompt Engineering، انتقل إلى CoddyKit PRO. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ماذا ستتعلم في «دمج النصوص والصور»؟
تلقينات موحّدة متعددة الوسائط. تتمرن على AI Prompt Engineering مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Prompt Engineering؟
لا تُشترط خبرة سابقة. AI Prompt Engineering على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.
كم من الوقت يستغرق درس «دمج النصوص والصور»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Prompt Engineering هذا؟
نعم. كل درس في AI Prompt Engineering يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.