माध्यमों के बीच ग्राउंडिंग
टेक्स्ट में दृश्य प्रमाण का संदर्भ देना।
माध्यमों के बीच ग्राउंडिंग, CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह AI प्रॉम्प्ट इंजीनियरिंग सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
आधार देने का अर्थ
आधार देना वह आवश्यकता है जिसमें हर पाठ-दावे को किसी दूसरे माध्यम के विशिष्ट साक्ष्य तक पहुँचाकर देखा जा सके। बिना आधार वाला बहुमाध्यमी उत्तर धाराप्रवाह अनुमान होता है; आधार वाला उत्तर ऐसा समर्थनीय दावा होता है जिसके पीछे उसे उचित ठहराने वाले पिक्सेल या ध्वनि-फ्रेम तक संकेत मौजूद होता है।
- आधार देना अपारदर्शी परिणाम को लेखापरीक्षण योग्य परिणाम में बदल देता है।
- आत्मविश्वास से किए गए दृश्य गढ़ंत के विरुद्ध यह सबसे प्रभावी उपाय है।
साक्ष्य-प्रथम तर्क क्रम
मॉडल को निष्कर्ष निकालने से पहले साक्ष्य निकालने के लिए बाध्य करें। यदि निष्कर्ष पहले तैयार हो जाता है, तो ‘साक्ष्य’ उस संभवतः गलत उत्तर से मेल खाती हुई बाद में गढ़ी गई तर्कसंगति बन जाती है।
उत्तर को इस तरह व्यवस्थित करें कि पहले देखे गए क्षेत्र आएँ, फिर उनकी व्याख्या और अंत में अंतिम उत्तर।
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.सीमांकन-चौखटे और क्षेत्र-संदर्भ
मॉडल से प्रत्येक दृश्य-दावे के लिए लगभग सामान्यीकृत निर्देशांक देने को कहें। अपूर्ण चौखटे भी उपयोगी होते हैं: आगे की प्रणाली crop करके फिर से जाँच कर सकती है, और बहुत गलत चौखटा तुरंत गढ़ंत को उजागर कर देता है।
- 0..1 के बीच सामान्यीकृत [x0,y0,x1,y1] का उपयोग करें, ताकि विभेदन अप्रासंगिक रहे।
- चौखटों को स्थानीयकरण संकेत मानें, पिक्सेल-स्तर की सटीक पहचान नहीं।
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)पिक्सेल उद्धरण द्वारा जाँच
छवि में दिखाई देने वाले किसी भी पाठ के लिए मॉडल से पढ़े गए पाठ का हूबहू उद्धरण माँगें। हूबहू उद्धरण की जाँच की जा सकती है: आप उसका OCR द्वारा नमूना-जाँच कर सकते हैं, और जिस मान को मॉडल को ठीक-ठीक लिखना भी पड़े, उसे गढ़ने की संभावना बहुत कम हो जाती है।
‘पढ़कर दोहराने’ की यह बाध्यता सस्ती है और दस्तावेज़ों, चार्टों तथा संकेत-पट्टों के लिए असाधारण रूप से प्रभावी है।
माध्यम-पार संगति जाँच
जब एक ही तथ्य दो माध्यमों में दिखाई दे, जैसे किसी स्लाइड की छवि और उसका बोला गया वर्णन, तो मॉडल से दोनों की आपस में जाँच करने को कहें। सहमति से भरोसा बढ़ता है; असहमति स्वयं ऐसा संकेत है जिसे सामने लाना उपयोगी है।
- ‘क्या चित्र का विवरण चार्ट में दिखाई देने वाली बात से मेल खाता है?’
- ‘क्या वर्णन स्क्रीन पर दिखाई देने वाली संख्या से सहमत है?’
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)आधार देने के परिणाम के रूप में अस्वीकार
आधार वाली प्रणाली को ‘दिखाई नहीं देता’ कहने की अनुमति होनी चाहिए। स्पष्ट बचाव-विकल्प के बिना मॉडल रिक्त स्थानों को संभावित गढ़ंत से भर देता है। यह विकल्प दें और इसे प्रोत्साहित करें।
निर्देश दें: ‘यदि साक्ष्य मौजूद न हो या अपठनीय हो, तो अनुमान लगाने के बजाय NOT_FOUND लौटाएँ।’ फिर ‘नहीं मिला’ को अपनी प्रक्रम-श्रृंखला में प्रथम-श्रेणी का, दंड-रहित परिणाम बनाएं।
स्थानिक संबंधों को आधार देना
संबंधात्मक दावों, जैसे ‘वाल्व गेज के बाईं ओर है’, को वस्तु की उपस्थिति के दावे की तुलना में आधार देना कठिन होता है। मॉडल से कहें कि वह दोनों संदर्भित वस्तुओं को स्वतंत्र रूप से चौखटों के साथ आधार दे, फिर सीधे संबंध बताने के बजाय निर्देशांकों से संबंध निकाले।
यह विघटन एक नाज़ुक संबंधात्मक निर्णय को दो सरल स्थानीयकरण कार्यों और अंकगणित में बदल देता है।
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]ध्वनि और समय-संबंधी आधार
आधार देने की प्रक्रिया छवियों से आगे भी लागू होती है। ध्वनि या वीडियो के लिए साक्ष्य के रूप में समय-मुद्राएँ आवश्यक करें: ‘वह बात जिस [mm:ss] पर कही गई, उसका संदर्भ दें।’ समय-संबंधी संकेत आपको स्रोत खंड से दावे की नमूना-जाँच करने देते हैं।
- समय-मुद्राएँ लिप्यंतरण और वक्ता-विभाजन संबंधी दावों को आधार देती हैं।
- वे ऐसे सारांश को उजागर करती हैं जो वास्तव में कही गई बात से भटक गया हो।
पाठ-अधिकार का जाल
पाठ चैनल में किया गया आत्मविश्वासपूर्ण दावा सही दृश्य साक्ष्य को दबा सकता है — मॉडल आपके दिए गए पूर्व-विश्वास को प्राथमिकता देता है। यदि आपके संदर्भ में लिखा है कि ‘चालान का कुल योग $400 है’ और छवि में $450 दिखाई देता है, तो बिना आधार वाला मॉडल $400 को ही दोहरा सकता है।
बचाव: मॉडल को पहले पूरी तरह छवि से निष्कर्ष निकालने, फिर दिए गए पाठ से तुलना करने और चुपचाप मिलान करने के बजाय असंगतियों को चिह्नित करने का निर्देश दें।
आगे की प्रक्रिया में आधार की जाँच
आधार देना तभी उपयोगी है जब आप उस पर कार्रवाई करें। एक ऐसा जाँचकर्ता बनाएं जो संरचित साक्ष्य का उपयोग करे:
- हर चौखटे पर फिर से crop करें और उद्धृत पाठ का फिर से OCR करें; अंतर मिले तो अस्वीकार करें।
- उद्धृत समय-मुद्रा को दूसरे ASR चरण से फिर चलाएँ।
- ‘नहीं मिला’ और विरोधाभास संकेतकों को मानव समीक्षा के लिए भेजने वाले संकेत मानें।
प्रॉम्प्ट साक्ष्य तैयार करता है; आपकी प्रणाली उसे लागू करती है।
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9आधार अनुबंध का साँचा
दोबारा उपयोग किए जा सकने वाले आधार अनुबंध में हर तकनीक शामिल होती है:
- निष्कर्षों से पहले अवलोकन।
- हर दावे के लिए चौखटा और हूबहू उद्धरण।
- ‘नहीं मिला’ का बचाव-विकल्प, कभी अनुमान न लगाएँ।
- पहले छवि से निष्कर्ष, फिर दिए गए पाठ से मिलान और विरोधों को चिह्नित करना।
- ध्वनि या वीडियो के किसी भी दावे के लिए समय-मुद्राएँ।
इसे एक बार औपचारिक रूप दें और हर बहुमाध्यमी कार्य में दोबारा उपयोग करें।
त्वरित जाँच
आपके संदर्भ-मेटाडेटा में कुल क्रम-मूल्य $400 बताया गया है, लेकिन आपको संदेह है कि स्कैन की गई छवि में यह अलग हो सकता है।
पुनरावलोकन: माध्यमों में आधार देना
आधार देना बहुमाध्यमी परिणाम को लेखापरीक्षण योग्य बनाता है: निष्कर्षों से पहले अवलोकन, हर दावे के लिए चौखटे और हूबहू उद्धरण, ध्वनि या वीडियो के लिए समय-मुद्राएँ, ‘नहीं मिला’ का बचाव-विकल्प, और दिए गए पाठ से विरोधों को चिह्नित करने वाला छवि-प्रथम निष्कर्ष। आधार अनुबंध को आगे की प्रणाली में काम करने वाले जाँचकर्ता के साथ जोड़ें, जो फिर से crop करे, फिर से पढ़े और संकेतों को समीक्षा के लिए भेजे। प्रॉम्प्ट में साक्ष्य, प्रणाली में प्रवर्तन — साथ मिलकर ये आत्मविश्वासपूर्ण गढ़ंत को निष्प्रभावी करते हैं।
एआई शिक्षक के साथ AI प्रॉम्प्ट इंजीनियरिंग सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 199
अक्सर पूछे जाने वाले प्रश्न
क्या “माध्यमों के बीच ग्राउंडिंग” पाठ निःशुल्क है?
हाँ — AI प्रॉम्प्ट इंजीनियरिंग अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “माध्यमों के बीच ग्राउंडिंग” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“माध्यमों के बीच ग्राउंडिंग” में मैं क्या सीखूँगा?
टेक्स्ट में दृश्य प्रमाण का संदर्भ देना। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI प्रॉम्प्ट इंजीनियरिंग का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या AI प्रॉम्प्ट इंजीनियरिंग शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“माध्यमों के बीच ग्राउंडिंग” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस AI प्रॉम्प्ट इंजीनियरिंग पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर AI प्रॉम्प्ट इंजीनियरिंग पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- टेक्स्ट और चित्रों को संयोजित करना
- माध्यमों के बीच ग्राउंडिंग
- ऑडियो, टेक्स्ट और विज़न साथ-साथ
- बहु-माध्यमीय आउटपुट नियंत्रण