पाइथन में Q-तालिका लागू करना
Q-अधिगम का एक सरल उदाहरण
पाइथन में Q-तालिका लागू करना, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 5 में से 3वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
पाइथन में Q-अधिगम लागू करना
इस पाठ में हम पाइथन में एक सरल Q-अधिगम कलनविधि लागू करेंगे। अभिकर्ता अपने पुरस्कारों को अधिकतम करने के लिए खानों की दुनिया में मार्ग ढूँढ़ना सीखेगा।

परिवेश को परिभाषित करना
हम 4×4 खानों वाली एक सरल दुनिया परिभाषित करते हैं, जहाँ अभिकर्ता ऊपरी-बाएँ कोने से शुरू होता है और पुरस्कार प्राप्त करने के लिए उसे निचले-दाएँ कोने तक पहुँचना होता है।
import numpy as np
# Define the environment
num_states = 16 # 4x4 grid
num_actions = 4 # Up, Down, Left, Right
# Define rewards (-1 for each step, +10 for the goal)
rewards = np.zeros(num_states)
rewards[-1] = 10Q-तालिका का प्रारंभीकरण
सभी स्थिति-क्रिया युग्मों के लिए Q-तालिका को zeros से प्रारंभ किया जाता है।
# Initialize the Q-Table
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)Q-लर्निंग कलनविधि का कार्यान्वयन
हम निम्नलिखित मापदंडों का उपयोग करते हैं:
- α (अधिगम दर): यह नियंत्रित करती है कि नई जानकारी पुरानी जानकारी को किस हद तक प्रतिस्थापित करे।
- γ (छूट गुणक): यह तत्काल प्रतिफलों की तुलना में भविष्य के प्रतिफलों को महत्व देता है।
- ε (अन्वेषण दर): यह अन्वेषण और दोहन के बीच संतुलन बनाती है।
# Parameters
alpha = 0.1 # Learning rate
gamma = 0.9 # Discount factor
epsilon = 0.1 # Exploration rate
# Q-Learning loop
num_episodes = 1000
for episode in range(num_episodes):
state = 0 # Start at the first state
done = False
while not done:
# Exploration or exploitation
if np.random.rand() < epsilon:
action = np.random.randint(num_actions) # Explore
else:
action = np.argmax(q_table[state]) # Exploit
# Transition to the next state
next_state = (state + action) % num_states # Simplified transition logic
reward = rewards[next_state]
# Update Q-value
q_table[state, action] = q_table[state, action] + alpha * (
reward + gamma * np.max(q_table[next_state]) - q_table[state, action]
)
# Move to the next state
state = next_state
done = state == num_states - 1सीखी हुई नीति का मूल्यांकन
प्रशिक्षण के बाद, हम Q-तालिका में संग्रहीत सर्वोत्तम क्रियाओं का अनुसरण करके नीति का मूल्यांकन करते हैं:
# Evaluate the policy
state = 0
optimal_path = [state]
while state != num_states - 1:
action = np.argmax(q_table[state])
state = (state + action) % num_states # Simplified transition logic
optimal_path.append(state)
print("Optimal Path:", optimal_path)Q-तालिका का दृश्यांकन
प्रत्येक स्थिति-क्रिया युग्म के लिए सीखे गए मानों को समझने हेतु हम Q-तालिका का दृश्यांकन कर सकते हैं:
import matplotlib.pyplot as plt
import seaborn as sns
# Visualize Q-Table
plt.figure(figsize=(10, 8))
sns.heatmap(q_table, annot=True, fmt=".2f", cmap="coolwarm")
plt.title("Q-Table Heatmap")
plt.xlabel("Actions")
plt.ylabel("States")
plt.show()Q-लर्निंग के लाभ
Q-लर्निंग के कई लाभ हैं:
- यह सरल है और इसे कार्यान्वित करना आसान है।
- यह प्रायिकतापूर्ण पर्यावरणों को संभाल सकता है।
- पर्याप्त अन्वेषण के साथ यह सर्वोत्तम नीति तक अभिसरित हो जाता है।
Q-लर्निंग की सीमाएँ
Q-लर्निंग की कुछ सीमाएँ हैं:
- यह बड़े स्थिति-क्रिया स्थान वाले पर्यावरणों के लिए अच्छी तरह विस्तारित नहीं हो पाता।
- जटिल पर्यावरणों में सीखना धीमा हो सकता है।
- इसके लिए स्पष्ट रूप से परिभाषित स्थिति-क्रिया निरूपण आवश्यक होता है।
सारांश और अगले चरण
इस पाठ में हमने:
- पाइथन में एक सरल Q-लर्निंग कलनविधि कार्यान्वित की।
- Q-तालिका का उपयोग करके एक एजेंट को ग्रिड-विश्व में मार्गनिर्देशन करना सिखाया।
- सीखी हुई नीति का मूल्यांकन किया और Q-तालिका का दृश्यांकन किया।
इसके बाद हम गहन Q-लर्निंग का अध्ययन करेंगे, जो बड़े स्थिति-क्रिया स्थान वाले पर्यावरणों को संभालने के लिए तंत्रिका नेटवर्क का उपयोग करती है।

एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 225
अक्सर पूछे जाने वाले प्रश्न
क्या “पाइथन में Q-तालिका लागू करना” पाठ निःशुल्क है?
हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “पाइथन में Q-तालिका लागू करना” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।
“पाइथन में Q-तालिका लागू करना” में मैं क्या सीखूँगा?
Q-अधिगम का एक सरल उदाहरण आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 3वाँ पाठ है।
“पाइथन में Q-तालिका लागू करना” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- सुदृढीकरण अधिगम की मूल अवधारणाएँ
- Q-Table की अवधारणा
- पाइथन में Q-तालिका लागू करना
- डीप Q-अधिगम
- OpenAI Gym का अन्वेषण