पाइथन के साथ एआई सीखें · पाठ

डीप Q-अधिगम

सुदृढीकरण अधिगम के लिए न्यूरल नेटवर्क का उपयोग

पाठ 4, कुल 5 में से10 चरण

डीप Q-अधिगम, CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 5 में से 4वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।

गहन Q-लर्निंग क्या है

गहन Q-लर्निंग

गहन Q-लर्निंग, Q-लर्निंग का एक विस्तार है, जो Q-तालिका का अनुमान लगाने के लिए तंत्रिका नेटवर्क का उपयोग करती है। इससे सुदृढीकरण अधिगम को बड़े या सतत स्थिति-क्रिया स्थान वाले पर्यावरणों तक विस्तारित किया जा सकता है।

डीप Q-अधिगम — चित्र 1

गहन Q-लर्निंग क्यों

गहन Q-लर्निंग पारंपरिक Q-लर्निंग की सीमाओं को दूर करती है:

  • यह उच्च-आयामी स्थिति स्थानों, जैसे चित्रों, को संभालती है।
  • यह स्मृति में बड़ी Q-तालिकाएँ संग्रहीत करने की आवश्यकता को समाप्त करती है।
  • यह तंत्रिका नेटवर्क का उपयोग करके विभिन्न स्थितियों में सामान्यीकरण करती है।

DQN कलनविधि

गहन Q-लर्निंग, Q-मानों का अनुमान लगाने के लिए Q-नेटवर्क नामक तंत्रिका नेटवर्क का उपयोग करती है। इसके मुख्य step ये हैं:

  1. यादृच्छिक भारों के साथ Q-नेटवर्क को प्रारंभ करें।
  2. अनुभव टपल (state, action, reward, next_state) एकत्र करने के लिए पर्यावरण के साथ अंतःक्रिया करें।
  3. बेलमैन समीकरण का उपयोग करके Q-नेटवर्क को अद्यतन करें:

Q(s, a) ≈ r + γ max(Q(s', a'))

Q-नेटवर्क का निर्माण

Q-नेटवर्क एक सरल फीडफ़ॉरवर्ड तंत्रिका नेटवर्क है, जो वर्तमान स्थिति को आगत के रूप में लेता है और सभी संभावित क्रियाओं के Q-मान निर्गत करता है:

import tensorflow as tf
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Dense

# Define the Q-Network
q_network = Sequential([
    Dense(24, activation='relu', input_shape=(state_space_size,)),
    Dense(24, activation='relu'),
    Dense(action_space_size, activation='linear')
])

q_network.compile(optimizer='adam', loss='mse')

अनुभव पुनःप्रयोग

सीखने में सुधार के लिए गहन Q-लर्निंग अनुभव पुनःप्रयोग नामक तकनीक का उपयोग करती है:

  • अनुभवों (state, action, reward, next_state) को स्मृति बफ़र में संग्रहीत करें।
  • Q-नेटवर्क को प्रशिक्षित करने के लिए अनुभवों के बैचों को यादृच्छिक रूप से sample करें।
from collections import deque

# Initialize replay memory
memory = deque(maxlen=2000)

# Add experience to memory
memory.append((state, action, reward, next_state, done))

Q-नेटवर्क का प्रशिक्षण

हम स्मृति बफ़र में मौजूद अनुभवों का उपयोग करके Q-नेटवर्क को प्रशिक्षित करते हैं:

import numpy as np

# Sample a batch of experiences
batch_size = 32
batch = random.sample(memory, batch_size)

# Train the Q-Network
for state, action, reward, next_state, done in batch:
    target = reward
    if not done:
        target += gamma * np.max(q_network.predict(next_state[np.newaxis, ...]))
    q_values = q_network.predict(state[np.newaxis, ...])
    q_values[0][action] = target
    q_network.fit(state[np.newaxis, ...], q_values, epochs=1, verbose=0)

लक्ष्य नेटवर्क

प्रशिक्षण को स्थिर करने के लिए DQN एक लक्ष्य नेटवर्क का उपयोग करता है:

  • लक्षित Q-मानों की गणना के लिए एक अलग नेटवर्क बनाए रखें।
  • समय-समय पर Q-नेटवर्क से लक्ष्य नेटवर्क में भारों की प्रतिलिपि बनाएँ।

गहन Q-लर्निंग के लाभ

गहन Q-लर्निंग के कई लाभ हैं:

  • यह चित्रों जैसे उच्च-आयामी स्थिति स्थानों को संभालती है।
  • यह तंत्रिका नेटवर्क का उपयोग करके विभिन्न स्थितियों में सामान्यीकरण करती है।
  • यह Atari खेलों और रोबोटिक नियंत्रण जैसे जटिल कार्यों को हल कर सकती है।

सारांश और अगले चरण

इस पाठ में हमने:

  • गहन Q-लर्निंग की मूलभूत बातों का अध्ययन किया।
  • Q-मानों का अनुमान लगाने के लिए Q-नेटवर्क बनाया।
  • स्थिर प्रशिक्षण के लिए अनुभव पुनःप्रयोग और लक्ष्य नेटवर्क पर चर्चा की।

इसके बाद हम OpenAI जिम का अध्ययन करेंगे और अनुकरण किए गए पर्यावरणों में सुदृढीकरण अधिगम लागू करेंगे।

डीप Q-अधिगम — चित्र 10
शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
53
पाठ
225

अक्सर पूछे जाने वाले प्रश्न

क्या “डीप Q-अधिगम” पाठ निःशुल्क है?

हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “डीप Q-अधिगम” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 5 पाठ शामिल हैं।

“डीप Q-अधिगम” में मैं क्या सीखूँगा?

सुदृढीकरण अधिगम के लिए न्यूरल नेटवर्क का उपयोग आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 4वाँ पाठ है।

“डीप Q-अधिगम” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. सुदृढीकरण अधिगम की मूल अवधारणाएँ
  2. Q-Table की अवधारणा
  3. पाइथन में Q-तालिका लागू करना
  4. डीप Q-अधिगम
  5. OpenAI Gym का अन्वेषण
← पाइथन के साथ एआई सीखें पर वापस जाएँ