Q-Table की अवधारणा
Table-आधारित Reinforcement Learning
Q-Table की अवधारणा, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 5 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
Q-तालिका क्या है?
Q-तालिका की अवधारणा
Q-तालिका सुदृढ़ीकरण अधिगम की एक मूलभूत अवधारणा है। यह एक खोज तालिका होती है, जिसमें प्रत्येक प्रविष्टि किसी दी गई अवस्था में कोई विशिष्ट क्रिया करने पर मिलने वाले अपेक्षित पुरस्कार को दर्शाती है।
लक्ष्य Q-मान सीखना है, जो अभिकर्ता को अधिकतम पुरस्कार प्राप्त करने के लिए सर्वोत्तम क्रियाएँ करने का मार्गदर्शन करते हैं।

Q-तालिका की संरचना
Q-तालिका की संरचना इस प्रकार होती है:
- पंक्तियाँ: परिवेश की अवस्थाओं को दर्शाती हैं।
- स्तंभ: अभिकर्ता के लिए उपलब्ध क्रियाओं को दर्शाते हैं।
- मान: अवस्था-क्रिया युग्मों के Q-मान को दर्शाते हैं।
अभिकर्ता अधिगम के दौरान इन मानों को अद्यतन करता है।
Q-मान अद्यतन सूत्र
Q-मानों को बेलमैन समीकरण का उपयोग करके अद्यतन किया जाता है:
Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]
जहाँ:
- s: वर्तमान अवस्था
- a: वर्तमान क्रिया
- r: क्रिया के लिए पुरस्कार
- s': अगली अवस्था
- α: अधिगम दर
- γ: छूट कारक
सरल Q-तालिका का उदाहरण
खानों की दुनिया के लिए Q-तालिका पर विचार कीजिए:
अवस्थाएँ: खानों की स्थितियाँ (जैसे, A1, B1)
क्रियाएँ: ऊपर, नीचे, बाएँ या दाएँ जाना
प्रारंभ में, सभी Q-मान शून्य पर निर्धारित होते हैं:
| अवस्था | ऊपर | नीचे | बाएँ | दाएँ |
|---|---|---|---|---|
| A1 | 0 | 0 | 0 | 0 |
| B1 | 0 | 0 | 0 | 0 |
पाइथन में Q-तालिका आरंभ करना
हम Q-तालिका को NumPy सारणी या शब्दकोश का उपयोग करके दर्शा सकते हैं:
import numpy as np
# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)Q-अधिगम में अन्वेषण
अभिकर्ता अन्वेषण और दोहन के बीच संतुलन बनाने के लिए ε-लोभी नीति का उपयोग करता है:
- ε प्रायिकता से, कोई यादृच्छिक क्रिया चुनें (अन्वेषण)।
- 1-ε प्रायिकता से, सर्वाधिक Q-मान वाली क्रिया चुनें (दोहन)।
Q-तालिकाओं के लाभ
Q-तालिकाएँ छोटे परिवेशों के लिए सरल और प्रभावी होती हैं। इनके लाभों में शामिल हैं:
- आसान कार्यान्वयन और त्रुटि-निवारण।
- अवस्था-क्रिया संबंधों की स्पष्ट व्याख्या।
- छोटे अवस्था-क्रिया स्थानों के लिए कम संगणनात्मक लागत।
Q-तालिकाओं की सीमाएँ
Q-तालिकाओं की कुछ सीमाएँ हैं:
- बड़े अवस्था-क्रिया स्थानों वाले परिवेशों के लिए ये विस्तार योग्य नहीं होतीं।
- उच्च-आयामी समस्याओं के लिए बहुत अधिक स्मृति की आवश्यकता होती है।
- समान अवस्थाओं के बीच सामान्यीकरण करने में असमर्थता।
सारांश और अगले चरण
इस पाठ में हमने:
- Q-तालिका की अवधारणा और उसकी संरचना के बारे में सीखा।
- बेलमैन समीकरण का उपयोग करके Q-मानों को अद्यतन करने की प्रक्रिया का अन्वेषण किया।
- Q-तालिकाओं के लाभों और सीमाओं पर चर्चा की।
अगले पाठ में हम पाइथन में एक सरल Q-अधिगम कलनविधि लागू करेंगे, ताकि Q-तालिकाओं को कार्य करते हुए देख सकें।

एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 225
अक्सर पूछे जाने वाले प्रश्न
क्या “Q-Table की अवधारणा” पाठ निःशुल्क है?
हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “Q-Table की अवधारणा” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
“Q-Table की अवधारणा” में मैं क्या सीखूँगा?
Table-आधारित Reinforcement Learning आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 2वाँ पाठ है।
“Q-Table की अवधारणा” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- सुदृढीकरण अधिगम की मूल अवधारणाएँ
- Q-Table की अवधारणा
- पाइथन में Q-तालिका लागू करना
- डीप Q-अधिगम
- OpenAI Gym का अन्वेषण