AI प्रॉम्प्ट इंजीनियरिंग · पाठ

ऑडियो, टेक्स्ट और विज़न साथ-साथ

कई इनपुट का समन्वय करना।

पाठ 3, कुल 4 में से13 चरण

ऑडियो, टेक्स्ट और विज़न साथ-साथ, CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह AI प्रॉम्प्ट इंजीनियरिंग सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

तीन चैनल, एक संदर्भ

ध्वनि, पाठ और विज़न का समन्वय करने का अर्थ है तीन आगत धाराओं को एक सुसंगत संदर्भ में व्यवस्थित करना। हर माध्यम की टोकन लागत, विश्वसनीयता-रूपरेखा और विफलता-प्रकार अलग होता है — फिर भी मॉडल उन्हें एक ही ध्यान-क्षेत्र में मिला देता है।

  • ध्वनि: समय-क्रम वाली, क्रमबद्ध और संपीड़न के दौरान हानिपूर्ण।
  • विज़न: स्थानिक, टाइल-बजट से सीमित और विवरण के प्रति नाज़ुक।
  • पाठ: सटीक और कम लागत वाला, लेकिन अन्य माध्यमों को अध्यारोपित करने में सक्षम।

कला यह है कि इनका क्रम इस तरह तय किया जाए कि हर माध्यम बाकी को दबाने के बजाय मजबूत करे।

माध्यमों का घोल नहीं, स्पष्ट भूमिकाएँ

प्रॉम्प्ट में प्रत्येक आगत के लिए स्पष्ट भूमिका तय करें। कौन-सा चैनल प्रामाणिक है, इस बारे में अस्पष्टता होने पर अलग-अलग बार असंगत उत्तर मिलते हैं।

  • विज़न = जो दिखाया गया है उसका वास्तविक आधार।
  • ध्वनि-लिप्यंतरण = उसके बारे में कही गई बात।
  • पाठ निर्देश = कार्य-अनुबंध और प्राथमिकता के नियम।

भूमिकाएँ पहले ही स्पष्ट कर दें, ताकि विरोध की स्थिति में मॉडल जान सके कि किस स्रोत को प्राथमिकता देनी है।

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

ध्वनि का फ्रेमों से समंजन

ध्वनि और विज़न का समय के अनुसार समंजन होना चाहिए, अन्यथा मॉडल गलत शब्दों को गलत छवि से जोड़ देगा। स्पष्ट समंजन दें: लिप्यंतरण और फ्रेमों पर समय-मुद्राएँ लगाएँ, फिर मॉडल को समय के आधार पर उन्हें जोड़ने दें।

समंजन मेटाडेटा के बिना मॉडल संबंध का अनुमान लगाता है — ढीले कार्यों के लिए यह ठीक है, लेकिन समकालिक विश्लेषण के लिए घातक।

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

पहले लिप्यंतरण बनाम कच्ची ध्वनि

आप कच्ची ध्वनि को सीधे किसी मूल ध्वनि मॉडल को दे सकते हैं, या समर्पित ASR चरण से पहले लिप्यंतरण बनाकर पाठ दे सकते हैं। दोनों के अपने लाभ और सीमाएँ हैं।

  • कच्ची ध्वनि: स्वर-लय, लहजा और एक-दूसरे पर चढ़ती वाणी को सुरक्षित रखती है — लेकिन अधिक टोकन खर्च करती है और इसका आधार देना कठिन होता है।
  • पहले से लिप्यंतरित: कम लागत वाली और समय-मुद्रा से संदर्भित की जा सकती है, लेकिन शब्देतर संकेत, जैसे व्यंग्य और तात्कालिकता, हटा देती है।

कार्य के अनुसार चुनें: भावना या आशय -> कच्ची ध्वनि; तथ्यात्मक निष्कर्षण -> लिप्यंतरण।

अंतर्गुंथन का क्रम

जिस क्रम में चैनल दिखाई देते हैं, वह ध्यान को प्रभावित करता है। विश्लेषण कार्यों के लिए एक मजबूत डिफ़ॉल्ट क्रम यह है:

  1. कार्य-अनुबंध और भूमिकाएँ (पाठ)।
  2. दृश्य साक्ष्य (फ्रेम), प्रत्येक पर लेबल और समय-मुद्रा सहित।
  3. समय-मुद्रा वाला ध्वनि-लिप्यंतरण।
  4. विशिष्ट प्रश्न (पाठ), जिसमें लेबल और समय का संदर्भ हो।

प्रश्न को अंत में रखने से उसका ध्यान पहले से कूटबद्ध सभी सामग्री पर जा सकता है।

टोकन बजट की प्राथमिकता-निर्धारण

तीन चैनल एक संदर्भ विंडो के लिए प्रतिस्पर्धा करते हैं। दृश्य सामग्री लागत पर हावी है; असंपीड़ित श्रव्य सामग्री दूसरे स्थान पर है। भेजने से पहले प्राथमिकता तय करें:

  • फ़्रेमों का नमूना उस दर से लें जिसकी कार्य को आवश्यकता है — हर फ़्रेम का नहीं।
  • फ़्रेमों को क्रिया-क्षेत्र तक सीमित करें।
  • श्रव्य सामग्री को प्रासंगिक खंडों में विभाजित करें; मौन हटा दें।

बजट वहीं खर्च करें जहाँ उत्तर मौजूद है।

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

बहु-माध्यमीय पारस्परिक पुष्टि

बहु-प्रवेश निर्देशों का सबसे बड़ा लाभ पारस्परिक पुष्टि है: जब एक ही तथ्य दो चैनलों से स्वतंत्र रूप से निकाला जा सकता है, तो सहमति मज़बूत प्रमाण होती है और असहमति ख़तरे का संकेत।

मॉडल को निर्देश दें कि वह प्रत्येक प्रमुख तथ्य को हर चैनल से अलग-अलग निकाले और सहमति की सूचना दे, बजाय इसके कि वह सबको मिलाकर एक ऐसा उत्तर दे जिसमें यह छिप जाए कि उसने किस स्रोत पर भरोसा किया।

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

गुम या खराब चैनलों से निपटना

वास्तविक प्रवेश-सामग्री की गुणवत्ता घट सकती है: दबा हुआ क्लिप, धुंधला फ़्रेम, अधूरा प्रतिलेख। मॉडल को बताएं कि आंशिक साक्ष्य के साथ कैसे आगे बढ़ना है, न कि उसे गुम चैनल की मनगढ़ंत जानकारी भरने दें।

  • 'यदि किसी खंड के लिए श्रव्य सामग्री समझ से बाहर हो, तो उसे [INAUDIBLE] चिह्नित करें।'
  • 'यदि कोई फ़्रेम पढ़ने के लिए बहुत धुंधला हो, तो उस फ़ील्ड के लिए पढ़ने_योग्य_नहीं लौटाएँ।'

सहज ढंग से होने वाला अवनयन चुपचाप गढ़ लेने से बेहतर है।

वक्ता और वस्तु का सह-संदर्भ

कठिन बहु-माध्यमीय कार्यों में कौन बोल रहा है (श्रव्य वक्ता-पृथक्करण) को कौन दिखाई दे रहा है (दृश्य सामग्री) से जोड़ना आवश्यक होता है। सह-संदर्भ को स्पष्ट करें: मॉडल से कहें कि वह समय और होंठों की गति या हाव-भाव जैसे दिखाई देने वाले संकेतों का उपयोग करके वक्ता-लेबलों को फ़्रेम में मौजूद व्यक्तियों से जोड़े।

हर संबद्धता के लिए समय-चिह्न और दृश्य संकेत, दोनों देकर उसका औचित्य बताना अनिवार्य करें।

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

परिणाम: संयुक्त लेकिन स्रोत-पता-योग्य उत्तर

अंतिम उत्तर पठनीयता के लिए संयुक्त होना चाहिए, फिर भी उसके नीचे हर चैनल तक स्रोत-पता बना रहना चाहिए। एक संरचित वस्तु जारी करें: संश्लेषित निष्कर्ष के साथ हर माध्यम से प्राप्त सहायक साक्ष्य और उसका समय-चिह्न या बॉक्स।

इससे लोग सुविधाजनक सारांश स्वीकार कर सकते हैं और फिर भी किसी एक दावे को उसके स्रोत चैनल तक वापस जाकर जाँच सकते हैं।

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

एक समन्वय जाँच-सूची

किसी भी त्रि-माध्यमीय कॉल से पहले जाँच लें:

  • भूमिकाएँ और प्राथमिकता क्रम स्पष्ट रूप से बताए गए हैं।
  • फ़्रेम और प्रतिलेख पर समय-चिह्न हैं और वे एक-दूसरे के अनुरूप हैं।
  • बजट में समाने के लिए चैनलों की प्राथमिकता तय की गई है।
  • पारस्परिक पुष्टि और असहमति-चिह्नन का अनुरोध किया गया है।
  • अवनयन टोकन परिभाषित हैं (INAUDIBLE, पढ़ने_योग्य_नहीं)।
  • परिणाम संयुक्त है, पर साक्ष्य तक स्रोत-पता लगाया जा सकता है।

हर बिंदु बहु-प्रवेश संयोजन की एक विशिष्ट विफलता-स्थिति को समाप्त करता है।

त्वरित जाँच

आप एक शिक्षण वीडियो का विश्लेषण कर रहे हैं और यह जानना चाहते हैं कि हर चरण पर कथावाचक का बोला हुआ दावा स्क्रीन पर दिखाई देने वाली क्रिया से मेल खाता है या नहीं।

पुनरावलोकन: अनेक प्रवेशों का समन्वय

त्रि-माध्यमीय निर्देश तब सफल होते हैं जब आप चैनल की स्पष्ट भूमिकाएँ और प्राथमिकता क्रम तय करते हैं, श्रव्य सामग्री और फ़्रेमों को समय-चिह्न के आधार पर संरेखित करते हैं, बजट में समाने के लिए हर चैनल की प्राथमिकता तय करते हैं और गुम साक्ष्य के लिए अवनयन टोकन के साथ प्रत्येक चैनल से पारस्परिक पुष्टि माँगते हैं। कच्ची श्रव्य सामग्री और पूर्व-प्रतिलेखन के बीच चुनाव इस आधार पर करें कि स्वर-लय महत्वपूर्ण है या नहीं। ऐसा संयुक्त सारांश दें जिसमें हर दावे का पता अब भी किसी बॉक्स या समय-चिह्न तक लगाया जा सके — पढ़ने में सुविधाजनक और जाँचने योग्य।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI प्रॉम्प्ट इंजीनियरिंग सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
53
पाठ
199

अक्सर पूछे जाने वाले प्रश्न

क्या “ऑडियो, टेक्स्ट और विज़न साथ-साथ” पाठ निःशुल्क है?

हाँ — AI प्रॉम्प्ट इंजीनियरिंग अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “ऑडियो, टेक्स्ट और विज़न साथ-साथ” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“ऑडियो, टेक्स्ट और विज़न साथ-साथ” में मैं क्या सीखूँगा?

कई इनपुट का समन्वय करना। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI प्रॉम्प्ट इंजीनियरिंग का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI प्रॉम्प्ट इंजीनियरिंग शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“ऑडियो, टेक्स्ट और विज़न साथ-साथ” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI प्रॉम्प्ट इंजीनियरिंग पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI प्रॉम्प्ट इंजीनियरिंग पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. टेक्स्ट और चित्रों को संयोजित करना
  2. माध्यमों के बीच ग्राउंडिंग
  3. ऑडियो, टेक्स्ट और विज़न साथ-साथ
  4. बहु-माध्यमीय आउटपुट नियंत्रण
← AI प्रॉम्प्ट इंजीनियरिंग पर वापस जाएँ