टेक्स्ट और चित्रों को संयोजित करना
एकीकृत बहु-माध्यमीय प्रॉम्प्ट।
टेक्स्ट और चित्रों को संयोजित करना, CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह AI प्रॉम्प्ट इंजीनियरिंग सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
एकीकृत बहुमाध्यमी निर्देश
बहुमाध्यमी निर्देश केवल पाठ के साथ संलग्न चित्र नहीं होता। यह एकल अंतर्गुंथित अनुक्रम होता है, जिसमें चित्र-इकाइयाँ और पाठ-इकाइयाँ एक ही संदर्भ में रहती हैं और एक-दूसरे पर ध्यान देती हैं। मॉडल 'पहले चित्र देखता और फिर पाठ पढ़ता' नहीं है—वह एक संयुक्त इकाई-प्रवाह को संसाधित करता है।
- चित्र-खंडों को पाठ-इकाइयों के समान अभिवेशन-स्थान में प्रक्षेपित किया जाता है।
- क्रम महत्वपूर्ण है: किसी चित्र से पहले रखा गया प्रश्न, उसके बाद रखे गए प्रश्न की तुलना में अलग ध्यान को सक्रिय करता है।
- आप दो बाहरी रूपों वाला एक ही निर्देश लिख रहे हैं, दो अलग निर्देश नहीं।
अंतर्गुंथन क्रम और आधार-स्थापन
निर्देश की तुलना में चित्र को कहाँ रखा जाता है, इससे व्यवहार बदल जाता है। निर्देश को चित्र के बाद रखने पर मॉडल पहले से कूटबद्ध की गई जानकारी के आधार पर प्रश्न का अर्थ ग्रहण कर सकता है; उसे पहले रखने पर चित्र पहले से बताए गए कार्य के लिए प्रमाण बन जाता है।
बहु-चित्र निर्देशों में हर चित्र को उसी स्थान पर चिह्नित करें, ताकि बाद का पाठ बिना किसी अस्पष्टता के उसका संदर्भ दे सके ([Image 1], [Image 2])।
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]एन्कोडिंग से पहले कार्य-निर्धारण
विज़न एन्कोडर हानिपूर्ण होते हैं: पूलिंग के दौरान निहित कार्य से असंबंधित विवरण हटाया जा सकता है। यदि आप छवि से पहले कार्य स्पष्ट कर देते हैं, तो मॉडल का ध्यान महत्वपूर्ण क्षेत्रों पर जाने की दिशा में प्रभावित होता है।
- सामान्य विवरण-अनुरोधों से सामान्य विशेषताएँ मिलती हैं।
- एक विशिष्ट प्रश्न, जैसे ‘बोर्ड पर प्रतिरोधकों की गिनती करें’, प्रतिनिधित्व बजट को प्रासंगिक उपक्षेत्रों पर केंद्रित करता है।
जब सूक्ष्म विवरण आवश्यक हो, तो विशिष्टता पहले ही स्पष्ट कर दें।
विभेदन और टाइल-विभाजन बजट
अधिकांश विज़न मॉडल उच्च-विभेदन वाली छवियों को निश्चित आकार वाले खंडों में बाँटते हैं, जिनमें से प्रत्येक की टोकन लागत होती है। 2000x2000 की छवि को कई खंडों में बाँटा जा सकता है और हर खंड का नमूना-आकार घटाया जा सकता है। टोकन बजट ही बहुमाध्यमी प्रॉम्प्टिंग की छिपी हुई सीमा है।
- भेजने से पहले रुचि वाले क्षेत्र पर crop करें — मॉडल के स्वयं ज़ूम करने पर निर्भर न रहें।
- घने दस्तावेज़ों के लिए एक पूरी पृष्ठ-छवि भेजने के बजाय पृष्ठ के crop भेजें।
- अपने सेवा-प्रदाता की अधिकतम खंड-संख्या जानें; उससे अधिक होने पर सूक्ष्म पाठ अपठनीय हो जाता है।
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailविज़न के लिए संरचित स्कीमा के रूप में पाठ
छवि को पाठ चैनल में दिए गए स्पष्ट परिणाम-स्कीमा के साथ मिलाएँ। छवि सामग्री देती है; पाठ अनुबंध देता है। यह मुक्त-रूप विवरण की तुलना में कहीं अधिक विश्वसनीय है।
मॉडल से उन इकाइयों की कुंजी वाला जेएसओएन माँगें जिन्हें आप देखने की अपेक्षा करते हैं, और निर्देश दें कि दिखाई न देने वाले क्षेत्रों के लिए null दे — इससे गढ़े हुए विवरण दब जाते हैं।
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)संकेतवाचक संदर्भ से अस्पष्टता दूर करना
संकेतवाचक संदर्भ, जैसे ‘यह’, ‘बाईं ओर वाला’, ‘उभारा गया चौखटा’, पाठ को छवि के क्षेत्रों से जोड़ते हैं। जब आप छवि पर पहले से टिप्पणियाँ जोड़ सकते हैं, जैसे चौखटा बनाना या तीर लगाना, तो पाठ का संदर्भ केवल स्थान-सूचक भाषा की तुलना में कहीं अधिक मजबूत हो जाता है।
- स्थान-सूचक शब्द, जैसे ‘ऊपरी-दायाँ’, घुमाव या crop की स्थिति में त्रुटिपूर्ण हो सकते हैं।
- छवि पर लगाया गया क्रमांकित चिह्न और ‘वस्तु #3’ का संयोजन अस्पष्टता रहित होता है।
- चिह्न जोड़ने के लिए छवि का पूर्व-प्रसंस्करण करना प्रॉम्प्ट-अभियांत्रिकी का उचित तरीका है।
मिश्रित माध्यमों के साथ कुछ-उदाहरणीय शिक्षण
प्रारूप और तर्क-शैली को स्थिर करने के लिए आप छवि-से-पाठ उदाहरण दे सकते हैं। प्रत्येक उदाहरण एक अंतर्गुंथे हुए (छवि, आदर्श-उत्तर) युग्म के रूप में होता है। मॉडल इन प्रदर्शनों से संबंध का अनुमान लगाता है।
उदाहरण-छवियों को वास्तविक वितरण का प्रतिनिधि रखें — किसी अलग क्षेत्र का उदाहरण मॉडल को गलत विशेषता-चयन सिखाता है।
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]दावों को पिक्सेल से आधार देना
उच्च-जोखिम निष्कर्षण के लिए मॉडल से अपेक्षा करें कि वह बताए कि छवि में प्रत्येक दावा कहाँ से प्राप्त हुआ है। लगभग सीमांकन-चौखटे या छवि पर मौजूद उद्धृत पाठ सत्यापन योग्य साक्ष्य का काम करते हैं और आत्मविश्वास से किए गए गढ़े हुए दावों को बहुत कम कर देते हैं।
- ‘हर मान के लिए, पढ़े गए सटीक लेबल-पाठ को उद्धृत करें।’
- ‘हर क्षेत्र के लिए लगभग सामान्यीकृत चौखटा [x0,y0,x1,y1] दें।’
आधार देना अपारदर्शी उत्तर को लेखापरीक्षण योग्य बना देता है।
जिन विफलता-प्रकारों से सावधान रहना चाहिए
बहुमाध्यमी मॉडल कुछ खास तरीकों से विफल होते हैं:
- छोटे या सजावटी फ़ॉन्ट पर OCR में विचलन — 1/7 और 0/O जैसे अंक भ्रमित हो जाते हैं।
- लगभग 6 से अधिक समान वस्तुओं पर गिनती विफल हो जाती है।
- विवरण-पक्षपात: वास्तविक दृश्य के बजाय सामान्य दृश्य का वर्णन करना।
- पाठ-चैनल का अध्यारोपण: आत्मविश्वास से किया गया गलत पाठ-दावा सही दृश्य साक्ष्य को दबा सकता है।
इसे कम करने के लिए मॉडल से कहें कि वह पहले छवि से निष्कर्ष निकाले और फिर पाठ में दिए गए दावों से उसका मिलान करे।
मिलान कराने वाले प्रॉम्प्ट
जब पाठ-संदर्भ और छवि में विरोध हो, तो आपको प्राथमिकता स्पष्ट रूप से तय करनी होगी — मॉडल की कोई ऐसी डिफ़ॉल्ट नीति नहीं होती जिस पर आप भरोसा कर सकें। इसे स्पष्ट रूप से लिखें: ‘यदि छवि दिए गए मेटाडेटा का खंडन करती है, तो छवि पर भरोसा करें और विसंगति को चिह्नित करें।’
यह एक वाक्य मौन त्रुटि को स्पष्ट और सामने आए हुए विरोध में बदल देता है, जिसे आपकी आगे की प्रक्रम-श्रृंखला समीक्षा के लिए भेज सकती है।
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)संयोजन प्रक्रम-श्रृंखला की संरचना
उत्पादन-स्तर की बहुमाध्यमी प्रॉम्प्टिंग एक प्रक्रम-श्रृंखला होती है, एकल कॉल नहीं:
- पूर्व-प्रसंस्करण: crop करें, टिप्पणियाँ जोड़ें और बजट के अनुसार आकार घटाएँ।
- संयोजन: कार्य-प्रथम निर्देश और परिणाम-स्कीमा के साथ अंतर्गुंथित करें।
- आधार देना: प्रत्येक दावे के लिए साक्ष्य आवश्यक करें।
- मिलान: माध्यमों के बीच प्राथमिकता स्पष्ट करें।
- सत्यापन: जेएसओएन का विश्लेषण करें और रिक्त मानों तथा विरोधाभास संकेतकों की जाँच करें।
हर चरण उस विफलता-क्षेत्र को छोटा करता है जिसे केवल प्रॉम्प्टिंग नियंत्रित नहीं कर सकती।
त्वरित जाँच
आपको उच्च-विभेदन वाले अनुबंध-स्कैन से सूक्ष्म अक्षर निकालने हैं और संख्याएँ विश्वसनीय चाहिए।
पुनरावलोकन: पाठ और छवियों का संयोजन
एकीकृत बहुमाध्यमी प्रॉम्प्ट एक अंतर्गुंथा हुआ टोकन-प्रवाह होता है। मुख्य उपाय हैं: विज़न एन्कोडर को दिशा देने के लिए कार्य-प्रथम रूपरेखा, crop के माध्यम से विभेदन और टाइल-विभाजन की समझ, रिक्त मान स्वीकार करने वाले स्पष्ट परिणाम-स्कीमा, प्रत्येक दावे के लिए पिक्सेल-आधारित आधार, और विरोध की स्थिति में माध्यमों की घोषित प्राथमिकता। इसे एक प्रक्रम-श्रृंखला मानें — पूर्व-प्रसंस्करण, संयोजन, आधार देना, मिलान और सत्यापन — तब विज़न प्रॉम्प्टिंग के नाज़ुक हिस्से नियंत्रित किए जा सकते हैं।
एआई शिक्षक के साथ AI प्रॉम्प्ट इंजीनियरिंग सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 199
अक्सर पूछे जाने वाले प्रश्न
क्या “टेक्स्ट और चित्रों को संयोजित करना” पाठ निःशुल्क है?
हाँ — AI प्रॉम्प्ट इंजीनियरिंग अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “टेक्स्ट और चित्रों को संयोजित करना” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“टेक्स्ट और चित्रों को संयोजित करना” में मैं क्या सीखूँगा?
एकीकृत बहु-माध्यमीय प्रॉम्प्ट। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI प्रॉम्प्ट इंजीनियरिंग का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या AI प्रॉम्प्ट इंजीनियरिंग शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।
“टेक्स्ट और चित्रों को संयोजित करना” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस AI प्रॉम्प्ट इंजीनियरिंग पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर AI प्रॉम्प्ट इंजीनियरिंग पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- टेक्स्ट और चित्रों को संयोजित करना
- माध्यमों के बीच ग्राउंडिंग
- ऑडियो, टेक्स्ट और विज़न साथ-साथ
- बहु-माध्यमीय आउटपुट नियंत्रण