LLMs को कैसे प्रशिक्षित किया जाता है
LLM प्रशिक्षण के चरणों को समझिए: विशाल कॉर्पस पर प्री-ट्रेनिंग, पर्यवेक्षित फ़ाइन-ट्यूनिंग और RLHF, और जानिए कि मॉडल के व्यवहार के लिए प्रत्येक चरण क्यों महत्त्वपूर्ण है।
LLMs को कैसे प्रशिक्षित किया जाता है, CoddyKit पर AI Engineering Academy का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI Engineering Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI Engineering Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
LLM प्रशिक्षण के तीन चरण
LLM तीन चरणों में बनाए जाते हैं: पूर्व-प्रशिक्षण भाषा और ज्ञान सिखाता है, सूक्ष्म-प्रशिक्षण निर्देशों का पालन करना सिखाता है, और RLHF मॉडल को लोगों की इच्छाओं के अनुरूप बनाता है।
पूर्व-प्रशिक्षण: बड़े पैमाने पर अगला टोकन अनुमान
पूर्व-प्रशिक्षण मॉडल को बहुत सारा पाठ देता है और केवल एक काम सौंपता है: अगले टोकन का अनुमान लगाना। यह सरल लक्ष्य रास्ते में व्याकरण, तथ्य और तर्क-विचार सिखाने के लिए पर्याप्त है।
प्रशिक्षण डेटा की गुणवत्ता और चयन
इंटरनेट का कच्चा पाठ अव्यवस्थित होता है। टीमें उसे डेटा पाइपलाइन से साफ़ करती हैं, जो फ़िल्टर करती हैं, दोहराव हटाती हैं और गुणवत्ता का अंक देती हैं। सामान्य नियम है: बड़ा मॉडल होने से बेहतर है बेहतर डेटा होना।
हानि फलन और अनुकूलन
प्रशिक्षण क्रॉस-एंट्रॉपी हानि को न्यूनतम करता है — यानी मॉडल का अनुमान सही अगले टोकन से कितना दूर है। वेट में बहुत छोटे बदलाव अरबों बार दोहराए जाते हैं। कोड इसका गणित दिखाता है।
# Illustrative cross-entropy loss for a single token prediction
import math
vocab_size = 50000
correct_token_index = 4217 # index for the word 'Paris'
# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size # simplified uniform base
model_probs[correct_token_index] = 0.70 # model is 70% confident in 'Paris'
loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}') # ~0.3567विस्तार से उभरती क्षमताएँ
पर्याप्त बड़े पैमाने पर नई उभरती क्षमताएँ दिखाई देती हैं — जैसे चरण-दर-चरण तर्क-विचार — जो छोटे मॉडलों में बिल्कुल नहीं होतीं। किसी ने उन्हें सीधे प्रशिक्षित नहीं किया; वे विस्तार के साथ उभरीं।
निर्देश-युग्मों पर पर्यवेक्षित सूक्ष्म-प्रशिक्षण
शुद्ध मॉडल केवल पाठ को आगे बढ़ाता है। पर्यवेक्षित सूक्ष्म-प्रशिक्षण उसे (निर्देश, आदर्श उत्तर) युग्मों पर प्रशिक्षित करता है, ताकि वह बिना भटके वास्तव में उत्तर देना सीखे।
# Illustrative SFT data format
training_example = {
'messages': [
{'role': 'system', 'content': 'You are a helpful assistant.'},
{'role': 'user', 'content': 'What is the capital of France?'},
{'role': 'assistant', 'content': 'The capital of France is Paris.'}
]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained onRLHF चरण 1: पुरस्कार मॉडल का प्रशिक्षण
RLHF की शुरुआत पुरस्कार मॉडल से होती है। लोग दो उत्तरों में से बेहतर उत्तर चुनते हैं और पुरस्कार मॉडल उन पसंदों का अनुमान लगाना सीखता है — यह मानवीय पसंद का प्रतिनिधि होता है।
RLHF चरण 2: PPO सूक्ष्म-प्रशिक्षण
इसके बाद PPO LLM को पुरस्कार मॉडल पर अधिक अंक पाने के लिए समायोजित करता है। KL दंड उसे अजीब ढंग से भटकने और वास्तव में मदद करने के बजाय पुरस्कार का अनुचित लाभ लेने से रोकता है।
प्रत्यक्ष पसंद अनुकूलन: सरल RLHF
PPO जटिल है। DPO इसका सरल विकल्प है: यह पसंद किए गए और अस्वीकार किए गए उत्तरों के युग्मों से सीधे मॉडल को प्रशिक्षित करता है — अलग पुरस्कार मॉडल की आवश्यकता नहीं होती।
Chinchilla विस्तार नियम: गणना-अनुकूल प्रशिक्षण
Chinchilla की खोज थी कि पुराने मॉडल कम प्रशिक्षित थे। किसी निश्चित बजट में डेटा और मॉडल के आकार को साथ-साथ बढ़ाइए — सर्वोत्तम परिणामों के लिए लगभग 20 टोकन प्रति पैरामीटर।
प्रशिक्षण का प्रत्येक चरण किसे प्रभावित करता है
प्रत्येक चरण किसी अलग चीज़ को नियंत्रित करता है: पूर्व-प्रशिक्षण तय करता है कि मॉडल क्या जानता है, सूक्ष्म-प्रशिक्षण तय करता है कि वह कैसे व्यवहार करता है, और RLHF उसके मूल्यों को तय करता है। इससे पता चलता है कि किस हिस्से को सुधारना है।
त्वरित जाँच
इस पाठ की AI इंजीनियरिंग अवधारणाओं की अपनी समझ जाँचिए।
पाठ का पुनरावलोकन
पुनरावलोकन: पूर्व-प्रशिक्षण ज्ञान बनाता है, सूक्ष्म-प्रशिक्षण निर्देशों का पालन करना सिखाता है, और RLHF या DPO मॉडल को मानवीय मूल्यों के अनुरूप बनाता है। अगला विषय: LLM क्या कर सकते हैं और क्या नहीं। 💡
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 30
- पाठ
- 120
अक्सर पूछे जाने वाले प्रश्न
क्या “LLMs को कैसे प्रशिक्षित किया जाता है” पाठ निःशुल्क है?
हाँ—“LLMs को कैसे प्रशिक्षित किया जाता है” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI Engineering Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI Engineering Academy पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“LLMs को कैसे प्रशिक्षित किया जाता है” में मैं क्या सीखूँगा?
LLM प्रशिक्षण के चरणों को समझिए: विशाल कॉर्पस पर प्री-ट्रेनिंग, पर्यवेक्षित फ़ाइन-ट्यूनिंग और RLHF, और जानिए कि मॉडल के व्यवहार के लिए प्रत्येक चरण क्यों महत्त्वपूर्ण है। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI Engineering Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या AI Engineering Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI Engineering Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।
“LLMs को कैसे प्रशिक्षित किया जाता है” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस AI Engineering Academy पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर AI Engineering Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- ऑटोकम्प्लीट से ChatGPT तक
- ट्रांसफ़ॉर्मर और अटेंशन को सरल भाषा में समझना
- LLMs को कैसे प्रशिक्षित किया जाता है
- LLMs की क्षमताएँ और सीमाएँ