الصوت والنص والرؤية معًا
تنسيق مدخلات متعددة.
الصوت والنص والرؤية معًا درس مجاني في AI Prompt Engineering على CoddyKit. هذا هو الدرس 3 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Prompt Engineering، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ثلاث قنوات، وسياق واحد
يتطلب تنسيق الصوت والنص والرؤية تنظيم ثلاثة تدفقات إدخال في سياق واحد متماسك. لكل وسيط تكلفة مختلفة للرموز، وخصائص مختلفة من حيث الدقة، وأنماط فشل مختلفة — ومع ذلك يدمجها النموذج في مساحة انتباه واحدة.
- الصوت: زمني، مرتب، وفاقد للمعلومات عند الضغط.
- الرؤية: مكانية، مقيدة بميزانية المربعات، وهشة أمام التفاصيل.
- النص: دقيق ومنخفض التكلفة، لكنه قادر على تجاوز الوسائط الأخرى.
يكمن التحدي في ترتيبها بحيث يعزز كل منها الآخر بدلًا من أن يطغى عليه.
أدوار الوسائط، لا خليط الوسائط
أسندوا إلى كل إدخال دورًا صريحًا في التوجيه. يؤدي الغموض بشأن القناة الموثوقة إلى إجابات غير متسقة بين التشغيلات.
- الرؤية = الحقيقة المرجعية لما هو ظاهر.
- النص المفرّغ من الصوت = ما يُقال عنه.
- تعليمة النص = عقد المهمة وقواعد الأولوية.
حدّدوا الأدوار مسبقًا حتى يعرف النموذج أي مصدر له الأولوية عند التعارض.
header = (
'INPUTS: (1) a video frame [authoritative for visible state], '
'(2) an audio transcript [authoritative for spoken intent], '
'(3) this instruction [defines the task]. '
'On conflict, prefer the frame for state and the transcript for intent.'
)محاذاة الصوت مع الإطارات
يجب محاذاة الصوت والرؤية زمنيًا، وإلا ربط النموذج الكلمات الخاطئة بالصورة الخاطئة. قدّموا محاذاة صريحة: ضعوا طابعًا زمنيًا للنص المفرّغ وللإطارات، ثم دعوا النموذج يربط بينها وفق الزمن.
من دون بيانات وصفية للمحاذاة، يخمّن النموذج العلاقة — وهذا مقبول في المهام غير الدقيقة، لكنه قاتل في التحليل المتزامن.
payload = {
'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
'transcript': [
{'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
{'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
]
}التفريغ المسبق أم الصوت الخام
يمكنكم تمرير الصوت الخام إلى نموذج صوت أصلي، أو إجراء تفريغ مسبق باستخدام خطوة ASR مخصصة وتمرير النص. ولكل خيار مزايا ومقايضات.
- الصوت الخام: يحافظ على التنغيم والنبرة والكلام المتداخل — لكنه يستهلك رموزًا أكثر ويصعب إسناده إلى الأدلة.
- المفرّغ مسبقًا: منخفض التكلفة ويمكن الاستشهاد به عبر الطابع الزمني، لكنه يتخلص من الإشارات غير المعجمية (السخرية والاستعجال).
اختاروا وفقًا للمهمة: العاطفة/النية -> الصوت الخام؛ الاستخراج الواقعي -> النص المفرّغ.
ترتيب التداخل
يؤثر الترتيب الذي تظهر به القنوات في الانتباه. وإليكم ترتيبًا افتراضيًا متينًا لمهام التحليل:
- عقد المهمة والأدوار (النص).
- الأدلة البصرية (الإطارات)، مع تسمية كل إطار ووضع طابعه الزمني.
- النص المفرّغ من الصوت، مع طوابع زمنية.
- السؤال المحدد (النص)، مع الإشارة إلى التسميات والأوقات.
يتيح وضع السؤال في النهاية للنموذج أن ينتبه إلى كل ما جرى ترميزه مسبقًا.
ترتيب أولويات ميزانية الرموز
تتنافس ثلاث قنوات على نافذة سياق واحدة. تستهلك الرؤية الحصة الأكبر؛ ويأتي الصوت غير المضغوط ثانيًا. رتّب الأولويات قبل الإرسال:
- خذ عينات من الإطارات بالمعدل الذي تتطلبه المهمة — لا من كل إطار.
- اقتطع الإطارات بحيث تقتصر على منطقة الحركة.
- قسّم الصوت إلى المقاطع ذات الصلة؛ واحذف الصمت.
أنفق الميزانية حيث توجد الإجابة.
def select_frames(frames, fps_target, src_fps):
step = max(1, round(src_fps / fps_target))
return frames[::step]التثبّت المتبادل بين الوسائط
أكبر فائدة من التلقين متعدد المدخلات هي التثبّت المتبادل: عندما يمكن اشتقاق الحقيقة نفسها بصورة مستقلة من قناتين، يكون الاتفاق دليلًا قويًا، ويكون الاختلاف علامة تحذير.
اطلب من النموذج اشتقاق كل حقيقة أساسية لكل قناة والإبلاغ عن الاتفاق، بدل اختزال ذلك في إجابة واحدة مدمجة تخفي المصدر الذي وثق به.
ask = (
'For each claim report: from_vision, from_audio, agree(bool). '
'If only one channel supports it, say which and lower confidence.'
)التعامل مع القنوات المفقودة أو المتدهورة
تتدهور المدخلات الواقعية: مقطع مكتوم، أو إطار ضبابي، أو تفريغ نصي مبتور. أخبر النموذج بكيفية المتابعة باستخدام الأدلة الجزئية، بدل أن تدعه يختلق محتوى القناة المفقودة.
- "إذا تعذر فهم الصوت في مقطع ما، فضع العلامة [INAUDIBLE]."
- "إذا كان الإطار ضبابيًا بدرجة تمنع قراءته، فأعد NOT_LEGIBLE لذلك الحقل."
التعامل السلس مع تدهور المدخلات أفضل من الاختلاق الصامت.
الإحالة المرجعية المشتركة بين المتحدث والكائن
تتطلب المهام صعبة التعددية الوسائط ربط من يتحدث (تحديد هوية المتحدثين صوتيًا) بـ من يظهر (الرؤية). اجعل الإحالة المشتركة صريحة: اطلب من النموذج ربط تسميات المتحدثين بالأشخاص الظاهرين في الإطار، باستخدام التوقيت والإشارات المرئية مثل حركة الشفاه أو الإيماءات.
ألزمه بتبرير كل إسناد بطابع زمني وإشارة مرئية معًا.
binding = {
'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}المخرجات: إجابة مدمجة قابلة للتتبع
ينبغي أن تكون الإجابة النهائية مدمجة لتسهيل قراءتها، مع الاحتفاظ بإمكانية تتبعها إلى كل قناة في الخلفية. أخرج كائنًا منظّمًا يتضمن الاستنتاج المركب، إلى جانب الأدلة الداعمة من كل وسيط مع طابعها الزمني أو مربع الإحاطة الخاص بها.
يتيح ذلك للبشر قبول الملخص المريح، مع إمكانية تدقيق أي ادعاء منفرد وإرجاعه إلى قناة مصدره.
out = {
'summary': 'The technician seated the bolt correctly.',
'evidence': [
{'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
{'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
]
}قائمة تحقق للتنسيق
تحقق قبل أي استدعاء ثلاثي الوسائط من الآتي:
- تحديد الأدوار والأولوية.
- إضافة طوابع زمنية إلى الإطارات والتفريغ النصي ومحاذاتهما.
- ترتيب أولويات القنوات بما يلائم الميزانية.
- طلب التثبّت المتبادل والإبلاغ عن الاختلافات.
- تحديد رموز التدهور (INAUDIBLE, NOT_LEGIBLE).
- دمج المخرجات مع إمكانية تتبع الأدلة.
يغلق كل عنصر وضع فشل محددًا في دمج المدخلات المتعددة.
تحقق سريع
تحلل فيديو تعليميًا وتحتاج إلى معرفة ما إذا كان الادعاء الذي ينطقه الراوي يطابق الإجراء الظاهر على الشاشة في كل خطوة.
مراجعة: تنسيق مدخلات متعددة
ينجح التلقين ثلاثي الوسائط عندما تحدد أدوار القنوات وأولويتها صراحةً، وتحاذي الصوت والإطارات باستخدام الطوابع الزمنية، وترتّب أولوية كل قناة بما يلائم الميزانية، وتطلب التثبّت المتبادل لكل قناة مع استخدام رموز التدهور للأدلة المفقودة. قرر بين الصوت الخام والتفريغ النصي المسبق بناءً على أهمية التنغيم. قدّم ملخصًا مدمجًا يتيح مع ذلك تتبع كل ادعاء إلى مربع إحاطة أو طابع زمني — سهل القراءة وقابل للتدقيق.
الأسئلة الشائعة
هل درس «الصوت والنص والرؤية معًا» مجاني؟
نعم — نص درس «الصوت والنص والرؤية معًا» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Prompt Engineering، انتقل إلى CoddyKit PRO. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ماذا ستتعلم في «الصوت والنص والرؤية معًا»؟
تنسيق مدخلات متعددة. تتمرن على AI Prompt Engineering مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Prompt Engineering؟
لا تُشترط خبرة سابقة. AI Prompt Engineering على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 3 من أصل 4.
كم من الوقت يستغرق درس «الصوت والنص والرؤية معًا»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Prompt Engineering هذا؟
نعم. كل درس في AI Prompt Engineering يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- دمج النصوص والصور
- الإسناد عبر الوسائط
- الصوت والنص والرؤية معًا
- التحكم في المخرجات متعددة الوسائط