الإسناد عبر الوسائط
الإشارة إلى الأدلة المرئية في النص.
الإسناد عبر الوسائط درس مجاني في AI Prompt Engineering على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Prompt Engineering، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ما المقصود بالإسناد إلى الأدلة
الإسناد إلى الأدلة هو اشتراط إمكانية تتبّع كل ادعاء نصي إلى دليل محدد في وسيط آخر. فالإجابة متعددة الوسائط غير المسندة إلى دليل هي تخمين بليغ؛ أما الإجابة المسندة إلى دليل فهي تأكيد يمكن الدفاع عنه، مع مؤشر يعود إلى وحدات البكسل (أو إطار الصوت) الذي يبرره.
- يحوّل الإسناد إلى الأدلة المخرجات المعتمة إلى مخرجات قابلة للتدقيق.
- وهو الوسيلة الأكثر فاعلية للحد من الهلوسة البصرية الواثقة.
ترتيب الاستدلال الذي يقدّم الأدلة
أجبروا النموذج على استخراج الأدلة قبل استخلاص النتيجة. فإذا وُلدت النتيجة أولًا، تحولت «الأدلة» إلى تبرير لاحق يطابق الإجابة (التي قد تكون خاطئة).
نظّموا الاستجابة بحيث تأتي المناطق المرصودة أولًا، ثم التفسير، ثم الإجابة النهائية.
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.الاستشهاد بالمربعات المحيطة والمناطق
اطلبوا من النموذج إخراج إحداثيات تقريبية مُطبّعة لكل ادعاء بصري. حتى المربعات غير المثالية مفيدة: إذ يمكن لنظام لاحق قصّها وإعادة التحقق منها، كما يكشف المربع الخاطئ جدًا عن الهلوسة فورًا.
- استخدموا [x0,y0,x1,y1] مُطبّعة ضمن 0..1، حتى لا تعود الدقة مؤثرة.
- تعاملوا مع المربعات بوصفها إشارات للموقع، لا كشفًا دقيقًا على مستوى البكسل.
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)التحقق عبر نقل النص من وحدات البكسل
بالنسبة إلى أي نص ظاهر في الصورة، اطلبوا نقل ما يقرأه النموذج حرفيًا. فالنقل الحرفي قابل للتحقق: يمكنكم إجراء فحص موضعي باستخدام OCR، ويصبح النموذج أقل ميلًا بكثير إلى اختلاق قيمة يجب عليه أيضًا نسخها بدقة.
هذا القيد، أي «إعادة قراءة النص»، منخفض التكلفة وفعال بدرجة تفوق حجمه في المستندات والمخططات واللافتات.
فحوص الاتساق عبر الوسائط
عندما تظهر الحقيقة نفسها في وسيطين (صورة شريحة وسردها المنطوق)، وجّهوا النموذج إلى التحقق المتبادل منهما. يرفع الاتفاق مستوى الثقة، بينما يمثل الاختلاف بحد ذاته إشارة تستحق الإظهار.
- «هل يتطابق تعليق الشكل مع ما يوضحه المخطط؟»
- «هل يتوافق السرد مع الرقم الظاهر على الشاشة؟»
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)الامتناع عن الإجابة كنتيجة للإسناد إلى الأدلة
يجب أن يُسمح للنظام المسند إلى الأدلة بأن يقول «غير ظاهر». فمن دون مخرج صريح، يملأ النموذج الفجوات باختلاق معقول ظاهريًا. وفّروا هذا المخرج وكافئوا استخدامه.
وجّهوا النموذج: «إذا لم يكن الدليل موجودًا أو كان غير مقروء، فأرجع NOT_FOUND بدلًا من التخمين.» ثم اجعلوا NOT_FOUND مخرجًا أساسيًا لا تُفرض عليه عقوبة في خط أنابيبكم.
إسناد العلاقات المكانية إلى الأدلة
يصعب إسناد الادعاءات العلائقية («الصمام إلى يسار مقياس الضغط») إلى الأدلة أكثر من إسناد وجود الكائن. اطلبوا من النموذج إسناد كل من الطرفين المرجعيين بصورة مستقلة باستخدام المربعات، ثم اشتقوا العلاقة من الإحداثيات بدلًا من التصريح بها مباشرة.
يحوّل هذا التفكيك حكمًا علائقيًا هشًا إلى مهمتي تحديد موقع أبسط، إضافةً إلى عملية حسابية.
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]الإسناد الزمني للصوت
يتجاوز الإسناد إلى الأدلة الصورَ أيضًا. بالنسبة إلى الصوت أو الفيديو، اطلبوا الطوابع الزمنية بوصفها أدلة: «اذكر الطابع [mm:ss] الذي قيل فيه هذا الكلام.» وتتيح المؤشرات الزمنية فحص الادعاء بمقارنته بالجزء المصدر.
- تثبت الطوابع الزمنية ادعاءات التفريغ الصوتي وتحديد هوية المتحدث.
- وتكشف التلخيص الذي ينحرف عما قيل فعليًا.
فخ تجاوز النص للأدلة البصرية
قد يؤدي تأكيد واثق في قناة النص إلى حجب الدليل البصري الصحيح — إذ ينحاز النموذج إلى الافتراض المسبق الذي قدمتموه. فإذا ذكر سياقكم «إجمالي الفاتورة هو $400» بينما تُظهر الصورة $450، فقد يكرر نموذج غير مسند إلى الأدلة قيمة $400.
الحماية: وجّهوا النموذج إلى الاستنتاج من الصورة وحدها أولًا، ثم مقارنتها بالنص المقدم، والإشارة إلى حالات عدم التطابق بدلًا من التوفيق بينها بصمت.
التحقق اللاحق من الإسناد إلى الأدلة
لا يكون الإسناد إلى الأدلة مفيدًا إلا إذا تصرفتم بناءً عليه. ابنوا أداة تحقق تستهلك الأدلة المهيكلة:
- أعيدوا قص كل مربع وأجروا OCR جديدًا للنص المنقول؛ إذا لم يتطابقا -> ارفضوا النتيجة.
- أعيدوا تشغيل الطابع الزمني المشار إليه عبر تمريرة ASR ثانية.
- تعاملوا مع NOT_FOUND وعلامات التعارض بوصفها إشارات لتوجيه الحالات إلى المراجعة البشرية.
ينتج التوجيه الدليل؛ أما نظامكم فيفرض الالتزام به.
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9قالب عقد الإسناد إلى الأدلة
يجمع عقد قابل لإعادة الاستخدام للإسناد إلى الأدلة كل التقنيات:
- الملاحظات قبل الاستنتاجات.
- مربع + نقل حرفي لكل ادعاء.
- مخرج NOT_FOUND، مع عدم التخمين مطلقًا.
- الاشتقاق من الصورة أولًا، ثم التوفيق مع النص المقدم والإشارة إلى التعارضات.
- طوابع زمنية لأي ادعاء متعلق بالصوت أو الفيديو.
صنّفوا هذه القواعد مرة واحدة وأعيدوا استخدامها في كل مهمة متعددة الوسائط.
تحقق سريع
تذكر البيانات الوصفية في سياقكم أن إجمالي الطلب هو $400، لكنكم تشكون في أن الصورة الممسوحة قد تعرض قيمة مختلفة.
مراجعة: الإسناد إلى الأدلة عبر الوسائط
يجعل الإسناد إلى الأدلة المخرجات متعددة الوسائط قابلة للتدقيق: ملاحظات قبل الاستنتاجات، ومربعات ونقول حرفية لكل ادعاء، وطوابع زمنية للصوت والفيديو، ومخرج NOT_FOUND، واشتقاق من الصورة أولًا يعلّم على التعارضات مع النص المقدم. اجمعوا عقد الإسناد إلى الأدلة مع أداة تحقق لاحقة تعيد القص والقراءة وتوجّه العلامات إلى المراجعة. الأدلة في التوجيه، والإنفاذ في النظام — معًا تحيدان الهلوسة الواثقة.
الأسئلة الشائعة
هل درس «الإسناد عبر الوسائط» مجاني؟
نعم — نص درس «الإسناد عبر الوسائط» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Prompt Engineering، انتقل إلى CoddyKit PRO. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ماذا ستتعلم في «الإسناد عبر الوسائط»؟
الإشارة إلى الأدلة المرئية في النص. تتمرن على AI Prompt Engineering مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Prompt Engineering؟
لا تُشترط خبرة سابقة. AI Prompt Engineering على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.
كم من الوقت يستغرق درس «الإسناد عبر الوسائط»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Prompt Engineering هذا؟
نعم. كل درس في AI Prompt Engineering يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- دمج النصوص والصور
- الإسناد عبر الوسائط
- الصوت والنص والرؤية معًا
- التحكم في المخرجات متعددة الوسائط