AI Engineering Academy · पाठ

LLMs को कैसे प्रशिक्षित किया जाता है

LLM प्रशिक्षण के चरणों को समझिए: विशाल कॉर्पस पर प्री-ट्रेनिंग, पर्यवेक्षित फ़ाइन-ट्यूनिंग और RLHF, और जानिए कि मॉडल के व्यवहार के लिए प्रत्येक चरण क्यों महत्त्वपूर्ण है।

पाठ 3, कुल 4 में से13 चरण

LLMs को कैसे प्रशिक्षित किया जाता है, CoddyKit पर AI Engineering Academy का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI Engineering Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI Engineering Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

LLM प्रशिक्षण के तीन चरण

LLM तीन चरणों में बनाए जाते हैं: पूर्व-प्रशिक्षण भाषा और ज्ञान सिखाता है, सूक्ष्म-प्रशिक्षण निर्देशों का पालन करना सिखाता है, और RLHF मॉडल को लोगों की इच्छाओं के अनुरूप बनाता है।

पूर्व-प्रशिक्षण: बड़े पैमाने पर अगला टोकन अनुमान

पूर्व-प्रशिक्षण मॉडल को बहुत सारा पाठ देता है और केवल एक काम सौंपता है: अगले टोकन का अनुमान लगाना। यह सरल लक्ष्य रास्ते में व्याकरण, तथ्य और तर्क-विचार सिखाने के लिए पर्याप्त है।

प्रशिक्षण डेटा की गुणवत्ता और चयन

इंटरनेट का कच्चा पाठ अव्यवस्थित होता है। टीमें उसे डेटा पाइपलाइन से साफ़ करती हैं, जो फ़िल्टर करती हैं, दोहराव हटाती हैं और गुणवत्ता का अंक देती हैं। सामान्य नियम है: बड़ा मॉडल होने से बेहतर है बेहतर डेटा होना।

हानि फलन और अनुकूलन

प्रशिक्षण क्रॉस-एंट्रॉपी हानि को न्यूनतम करता है — यानी मॉडल का अनुमान सही अगले टोकन से कितना दूर है। वेट में बहुत छोटे बदलाव अरबों बार दोहराए जाते हैं। कोड इसका गणित दिखाता है।

# Illustrative cross-entropy loss for a single token prediction
import math

vocab_size = 50000
correct_token_index = 4217  # index for the word 'Paris'

# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size  # simplified uniform base
model_probs[correct_token_index] = 0.70  # model is 70% confident in 'Paris'

loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}')  # ~0.3567

विस्तार से उभरती क्षमताएँ

पर्याप्त बड़े पैमाने पर नई उभरती क्षमताएँ दिखाई देती हैं — जैसे चरण-दर-चरण तर्क-विचार — जो छोटे मॉडलों में बिल्कुल नहीं होतीं। किसी ने उन्हें सीधे प्रशिक्षित नहीं किया; वे विस्तार के साथ उभरीं।

निर्देश-युग्मों पर पर्यवेक्षित सूक्ष्म-प्रशिक्षण

शुद्ध मॉडल केवल पाठ को आगे बढ़ाता है। पर्यवेक्षित सूक्ष्म-प्रशिक्षण उसे (निर्देश, आदर्श उत्तर) युग्मों पर प्रशिक्षित करता है, ताकि वह बिना भटके वास्तव में उत्तर देना सीखे।

# Illustrative SFT data format
training_example = {
    'messages': [
        {'role': 'system', 'content': 'You are a helpful assistant.'},
        {'role': 'user', 'content': 'What is the capital of France?'},
        {'role': 'assistant', 'content': 'The capital of France is Paris.'}
    ]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained on

RLHF चरण 1: पुरस्कार मॉडल का प्रशिक्षण

RLHF की शुरुआत पुरस्कार मॉडल से होती है। लोग दो उत्तरों में से बेहतर उत्तर चुनते हैं और पुरस्कार मॉडल उन पसंदों का अनुमान लगाना सीखता है — यह मानवीय पसंद का प्रतिनिधि होता है।

RLHF चरण 2: PPO सूक्ष्म-प्रशिक्षण

इसके बाद PPO LLM को पुरस्कार मॉडल पर अधिक अंक पाने के लिए समायोजित करता है। KL दंड उसे अजीब ढंग से भटकने और वास्तव में मदद करने के बजाय पुरस्कार का अनुचित लाभ लेने से रोकता है।

प्रत्यक्ष पसंद अनुकूलन: सरल RLHF

PPO जटिल है। DPO इसका सरल विकल्प है: यह पसंद किए गए और अस्वीकार किए गए उत्तरों के युग्मों से सीधे मॉडल को प्रशिक्षित करता है — अलग पुरस्कार मॉडल की आवश्यकता नहीं होती।

Chinchilla विस्तार नियम: गणना-अनुकूल प्रशिक्षण

Chinchilla की खोज थी कि पुराने मॉडल कम प्रशिक्षित थे। किसी निश्चित बजट में डेटा और मॉडल के आकार को साथ-साथ बढ़ाइए — सर्वोत्तम परिणामों के लिए लगभग 20 टोकन प्रति पैरामीटर।

प्रशिक्षण का प्रत्येक चरण किसे प्रभावित करता है

प्रत्येक चरण किसी अलग चीज़ को नियंत्रित करता है: पूर्व-प्रशिक्षण तय करता है कि मॉडल क्या जानता है, सूक्ष्म-प्रशिक्षण तय करता है कि वह कैसे व्यवहार करता है, और RLHF उसके मूल्यों को तय करता है। इससे पता चलता है कि किस हिस्से को सुधारना है।

त्वरित जाँच

इस पाठ की AI इंजीनियरिंग अवधारणाओं की अपनी समझ जाँचिए।

पाठ का पुनरावलोकन

पुनरावलोकन: पूर्व-प्रशिक्षण ज्ञान बनाता है, सूक्ष्म-प्रशिक्षण निर्देशों का पालन करना सिखाता है, और RLHF या DPO मॉडल को मानवीय मूल्यों के अनुरूप बनाता है। अगला विषय: LLM क्या कर सकते हैं और क्या नहीं। 💡

शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
30
पाठ
120

अक्सर पूछे जाने वाले प्रश्न

क्या “LLMs को कैसे प्रशिक्षित किया जाता है” पाठ निःशुल्क है?

हाँ—“LLMs को कैसे प्रशिक्षित किया जाता है” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI Engineering Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI Engineering Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“LLMs को कैसे प्रशिक्षित किया जाता है” में मैं क्या सीखूँगा?

LLM प्रशिक्षण के चरणों को समझिए: विशाल कॉर्पस पर प्री-ट्रेनिंग, पर्यवेक्षित फ़ाइन-ट्यूनिंग और RLHF, और जानिए कि मॉडल के व्यवहार के लिए प्रत्येक चरण क्यों महत्त्वपूर्ण है। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI Engineering Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI Engineering Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI Engineering Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“LLMs को कैसे प्रशिक्षित किया जाता है” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI Engineering Academy पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI Engineering Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. ऑटोकम्प्लीट से ChatGPT तक
  2. ट्रांसफ़ॉर्मर और अटेंशन को सरल भाषा में समझना
  3. LLMs को कैसे प्रशिक्षित किया जाता है
  4. LLMs की क्षमताएँ और सीमाएँ
← AI Engineering Academy पर वापस जाएँ