AI प्रॉम्प्ट इंजीनियरिंग · पाठ

फ़ाइन-ट्यूनिंग कब करें

वे संकेत कि प्रॉम्प्टिंग अपनी सीमाओं तक पहुँच गई है।

पाठ 2, कुल 4 में से13 चरण

फ़ाइन-ट्यूनिंग कब करें, CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह AI प्रॉम्प्ट इंजीनियरिंग सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

फाइन-ट्यूनिंग साक्ष्य-आधारित निर्णय है

फाइन-ट्यूनिंग तभी उचित है जब आप ऐसा डेटा दिखा सकें जो यह प्रमाणित करे कि प्रॉम्प्टिंग की सीमा आ गई है। इसका कारण कभी अनुमान नहीं होता—यह अलग रखे गए मूल्यांकन का परिणाम होता है, जहाँ अनुकूलन की सीढ़ी चढ़ने के बावजूद सबसे अच्छा वास्तविक प्रॉम्प्ट आपके गुणवत्ता-मानक से नीचे plateaued रहता है।

  • ट्यूनिंग लचीलेपन के बदले निरंतरता, हर कॉल की कम लागत और सीखा हुआ व्यवहार देती है
  • इसकी लागत में डेटा-प्रवाह, मूल्यांकन अवसंरचना और आधार मॉडल में बदलाव होने पर फिर से ट्यूनिंग शामिल है
  • आपको उस विशिष्ट विफलता की पहचान कर सकना चाहिए जिसे प्रॉम्प्टिंग ठीक नहीं कर सकी

संकेत 1: प्रॉम्प्ट की प्रगति रुकना

सबसे स्पष्ट संकेत स्थिर मूल्यांकन-समुच्चय पर प्रगति रुकना है। आप उदाहरण जोड़ते हैं, विभाजन करते हैं, सत्यापक जोड़ते हैं—और त्रुटियाँ व्यवस्थित बनी रहती हैं, आकस्मिक नहीं, फिर भी अंक में सुधार रुक जाता है।

व्यवस्थित बची हुई त्रुटियाँ—मॉडल लगातार उसी रचना को गलत ढंग से संभालता है—दिखाती हैं कि निर्देशों के माध्यम से यह व्यवहार उत्पन्न करना कठिन है। यह ट्यूनिंग के लिए उपयुक्त समस्या है। बेतरतीब, इधर-उधर फैली त्रुटियों का अर्थ आमतौर पर यह होता है कि प्रॉम्प्ट या डेटा अभी भी शोरयुक्त है—इसके बजाय पुनरावृत्ति जारी रखें।

# Track eval score vs prompt-iteration; flat tail = plateau
scores = [0.62, 0.71, 0.78, 0.79, 0.795, 0.796]  # diminishing returns
def plateaued(scores, window=3, eps=0.01):
    tail = scores[-window:]
    return (max(tail) - min(tail)) < eps

print(plateaued(scores))  # True -> prompting has stalled

संकेत 2: प्रॉम्प्ट ही उत्पाद बन जाता है

जब गुणवत्ता बनाए रखने के लिए प्रॉम्प्ट में हजारों टोकन के उदाहरण और नियम जुड़ जाते हैं, तब आप हर कॉल पर विलंबता और लागत का कर चुका रहे होते हैं, ताकि सीखे हुए व्यवहार का अनुकरण किया जा सके।

यदि वे टोकन स्थिर, दोहराए जाने वाले व्यवहार को कूटबद्ध करते हैं—जैसे निश्चित प्रारूप, सुसंगत शैली या मार्ग-चयन का निर्णय—तो फाइन-ट्यूनिंग उन्हें मॉडल के भारों में समाहित कर सकती है। इससे व्यवहार बनाए रखते हुए प्रॉम्प्ट लगभग दस गुना छोटा हो जाता है। इसे प्रॉम्प्ट आसवन कहते हैं और यह ट्यूनिंग का सबसे आम वैध उपयोग-मामला है।

संकेत 3: कठोर विलंबता या लागत-सीमा

यदि आपको किसी सीमित कार्य पर बड़े मॉडल के व्यवहार से मेल खाने वाला छोटा, तेज़ और सस्ता मॉडल चाहिए, तो ट्यूनिंग सही उपकरण है। आप बड़े मॉडल के आउटपुट को छोटे ट्यून किए गए मॉडल में आसवित करते हैं।

यह तब उचित है जब मात्रा लागत-बराबरी बिंदु से ऊपर हो, विलंबता-सीमा कड़ी हो और कार्य इतना सीमित हो कि छोटा मॉडल उसमें दक्ष हो सके। इन परिस्थितियों के बाहर अभियांत्रिकी का अतिरिक्त बोझ इसके योग्य नहीं है।

# Distillation data: teacher (big model) labels -> student (small) trains
def make_distill_pair(prompt, teacher_fn):
    completion = teacher_fn(prompt)  # high-quality big-model output
    return {'messages': [
        {'role': 'user', 'content': prompt},
        {'role': 'assistant', 'content': completion},
    ]}

संकेत 4: विशिष्ट प्रारूप या शैली

कुछ आउटपुट इतने विशिष्ट होते हैं कि उन्हें समझाने में बड़े पैमाने पर उदाहरण देने की तुलना में अधिक लागत आती है: स्वामित्व वाला DSL, हजारों सूक्ष्म नियमों वाली संस्था की लेखन-शैली या असंख्य सशर्त क्षेत्रों वाला कठोर क्षेत्र-विशिष्ट स्कीमा।

जब प्रारूप-अनुपालन लगभग पूर्ण होना आवश्यक हो और नियमों की संख्या इतनी अधिक हो कि उन्हें प्रॉम्प्ट में गिनाया न जा सके, तब सैकड़ों उदाहरण गद्य की तुलना में पैटर्न अधिक विश्वसनीय ढंग से सिखाते हैं। ट्यूनिंग उस अंतर्निहित संरचना को आत्मसात करने में उत्कृष्ट है जो स्पष्ट निर्देशों का विरोध करती है।

संकेत 5: ऐसा व्यवहार जिसका मॉडल विरोध करता है

कभी-कभी मॉडल किसी निर्देश का विरोध करता है: आपके मना करने के बावजूद चेतावनियाँ जोड़ता रहता है, किसी सुरक्षित कार्य से इनकार करता है या अधिक भार में डिफ़ॉल्ट शैली पर लौट जाता है। यदि सशक्त, बार-बार दिए गए निर्देश और उदाहरण इस व्यवहार को विश्वसनीय रूप से दबा नहीं पाते, तो यह आधार मॉडल के भारों में पहले से अंतर्निहित पूर्व-प्रवृत्ति है।

ट्यूनिंग ऐसी पूर्व-प्रवृत्तियों को बदल सकती है। लेकिन पहले पुष्टि कर लें कि प्रतिरोध वास्तविक है, केवल प्रॉम्प्ट की अस्पष्टता की समस्या नहीं—गलत ढंग से प्रतिरोध मान लेने पर अनावश्यक प्रशिक्षण प्रक्रियाएँ शुरू हो जाती हैं।

विरोधी संकेत: कब NOT ट्यून करें

झूठे संकेतों को पहचानना भी उतना ही महत्वपूर्ण है। इन स्थितियों में फाइन-ट्यूनिंग न करें (NOT):

  • कमी ज्ञान की है—इसके बजाय उसे पुनर्प्राप्त करें; ट्यूनिंग पुराने और हानिपूर्ण तथ्यों को स्थायी बना देती है
  • विनिर्देश अभी भी हर सप्ताह बदल रहा है—आपको लगातार दोबारा प्रशिक्षण देना पड़ेगा
  • आपके पास कुछ सौ से कम साफ़ उदाहरण हैं—संकेत बहुत कम और अधिक-अनुरूपण का जोखिम बहुत अधिक है
  • त्रुटियाँ बेतरतीब हैं, व्यवस्थित नहीं—डेटा या प्रॉम्प्ट अभी भी शोरयुक्त है
  • आपके पास मूल्यांकन ढाँचा नहीं है—आप यह नहीं जान सकते कि ट्यूनिंग से कोई लाभ हुआ भी या नहीं

डेटा-तैयारी जाँच-द्वार

फाइन-ट्यूनिंग की गुणवत्ता डेटा की गुणवत्ता से सीमित होती है। प्रतिबद्ध होने से पहले तैयारी-जाँच पार करें: पर्याप्त उदाहरण हों, जिन मामलों की आपको परवाह है उनमें संतुलित हों, लेबल आपस में सुसंगत हों और उस डेटा-रिसाव से मुक्त हों जो मूल्यांकन अंकों को कृत्रिम रूप से बढ़ाता है।

बहुत सावधानी से चुने गए कुछ सौ उदाहरण, शोरयुक्त दसियों हजार उदाहरणों से बेहतर होते हैं। यदि आपके लेबल आपस में असहमत हैं, तो मॉडल शोर सीख लेगा।

def data_ready(examples, min_n=300, max_dupe_ratio=0.05):
    n = len(examples)
    texts = [e['messages'][0]['content'] for e in examples]
    dupe_ratio = 1 - (len(set(texts)) / n)
    return n >= min_n and dupe_ratio <= max_dupe_ratio

# Returns False until you have enough deduped, curated examples

ट्यूनिंग विधि चुनें

हर ट्यूनिंग पूर्ण-भार प्रशिक्षण नहीं होती। संकेत के अनुरूप विधि चुनें:

  • LoRA / अनुकूलक - सस्ते, तेज़ और वापस किए जा सकने वाले; शैली और प्रारूप के आसवन के लिए आदर्श
  • पूर्ण फाइन-ट्यूनिंग - अधिक संसाधन वाली; सक्षम खुले मॉडलों में गहरे व्यवहारगत बदलावों के लिए
  • प्राथमिकता ट्यूनिंग (DPO-शैली) - जब आपके पास स्वर्णिम पूर्णताओं के बजाय युग्मित अच्छे/बुरे निर्णय हों

संकेत जितनी हल्की विधि की माँग करे, उसी से शुरुआत करें। LoRA-शैली के अनुकूलक उत्पादन के अधिकांश मामलों को लागत के एक छोटे अंश में संभाल लेते हैं।

पूर्व-प्रतिबद्धता प्रोटोकॉल

प्रशिक्षण प्रक्रिया शुरू करने से पहले प्रयोग को तय कर लें, ताकि परिणाम की व्याख्या की जा सके:

  • एक अलग रखा गया मूल्यांकन-समुच्चय स्थिर करें, जिसे मॉडल प्रशिक्षण में कभी नहीं देखेगा
  • उस समुच्चय पर केवल प्रॉम्प्ट के आधार पर मिले सर्वोत्तम आधार-प्रदर्शन अंक दर्ज करें
  • लक्षित सुधार और अधिकतम लागत पहले ही तय करें
  • पुनर्वापसी की शर्त तय करें: यदि ट्यून किया मॉडल लक्ष्य के अनुसार आधार-प्रदर्शन से बेहतर नहीं होता, तो प्रॉम्प्ट को ही जारी करें

पहले से तय आधार-प्रदर्शन और लक्ष्य के बिना आप यह प्रमाणित नहीं कर सकते कि ट्यूनिंग अपनी लागत के योग्य थी।

संकेतों को एक साथ रखना

संकेतों को एक ही आगे बढ़ें/रुकें जाँच-द्वार में मिलाइए। ट्यूनिंग तभी आगे बढ़ती है जब प्रॉम्प्टिंग plateaued हो AND डेटा data_ready हो AND कमी व्यवहार की हो—किसी एक संकेत के अकेले उभरने पर नहीं।

def should_fine_tune(plateaued, data_ready, gap_is_behavior,
                     spec_stable, has_eval_harness):
    return all([
        plateaued,        # prompting stalled on frozen eval
        data_ready,       # enough clean, deduped examples
        gap_is_behavior,  # not a knowledge gap (else use RAG)
        spec_stable,      # task definition has settled
        has_eval_harness, # can measure the lift
    ])

print(should_fine_tune(True, True, True, True, True))  # True -> proceed

त्वरित जाँच

एक स्थिर मूल्यांकन-समुच्चय पर मॉडल की त्रुटियाँ अलग-अलग और बेतरतीब हैं, कई तरह के इनपुट में फैली हुई हैं और उदाहरणों में छोटे बदलाव करने पर भी अंक बढ़ते रहते हैं। इससे फाइन-ट्यूनिंग की तैयारी के बारे में क्या संकेत मिलता है?

संक्षेप

अंतर्ज्ञान पर नहीं, साक्ष्य के आधार पर फाइन-ट्यूनिंग करें। वैध संकेत हैं: व्यवस्थित त्रुटियों के साथ वास्तविक प्रगति-रुकाव, ऐसा प्रॉम्प्ट जिसकी लंबाई ही उत्पाद बन गई हो, कठोर विलंबता या लागत-सीमा, विशिष्ट प्रारूप या ऐसा व्यवहार जिसका आधार मॉडल विरोध करता हो।

  • विरोधी संकेत: ज्ञान की कमियाँ, बदलते विनिर्देश, बहुत कम डेटा, बेतरतीब त्रुटियाँ और मूल्यांकन ढाँचे का अभाव
  • प्रशिक्षण से पहले डेटा-तैयारी जाँच-द्वार पार करें—गुणवत्ता ही परिणाम की सीमा तय करती है
  • संकेत जितनी हल्की विधि की माँग करे, उसी का चयन करें—पहले LoRA-शैली अपनाएँ
  • स्थिर मूल्यांकन, आधार-प्रदर्शन, लक्षित सुधार और पुनर्वापसी की शर्त पहले ही तय करें
  • केवल तब आगे बढ़ें जब प्रगति-रुकाव AND डेटा-तैयारी AND व्यवहार-अंतर—तीनों मौजूद हों
शुरुआत निःशुल्क

एआई शिक्षक के साथ AI प्रॉम्प्ट इंजीनियरिंग सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
53
पाठ
199

अक्सर पूछे जाने वाले प्रश्न

क्या “फ़ाइन-ट्यूनिंग कब करें” पाठ निःशुल्क है?

हाँ — AI प्रॉम्प्ट इंजीनियरिंग अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “फ़ाइन-ट्यूनिंग कब करें” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। AI प्रॉम्प्ट इंजीनियरिंग पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“फ़ाइन-ट्यूनिंग कब करें” में मैं क्या सीखूँगा?

वे संकेत कि प्रॉम्प्टिंग अपनी सीमाओं तक पहुँच गई है। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI प्रॉम्प्ट इंजीनियरिंग का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI प्रॉम्प्ट इंजीनियरिंग शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI प्रॉम्प्ट इंजीनियरिंग शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।

“फ़ाइन-ट्यूनिंग कब करें” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI प्रॉम्प्ट इंजीनियरिंग पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI प्रॉम्प्ट इंजीनियरिंग पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. प्रॉम्प्टिंग कब पर्याप्त है
  2. फ़ाइन-ट्यूनिंग कब करें
  3. हाइब्रिड: प्रॉम्प्ट और हल्की ट्यूनिंग
  4. निर्णय का मूल्यांकन
← AI प्रॉम्प्ट इंजीनियरिंग पर वापस जाएँ