Actor-Critic विधियाँ (A2C)
Advantage function, actor (policy) और critic (value), तथा synchronous A2C कार्यान्वयन।
Actor-Critic विधियाँ (A2C), CoddyKit पर पाइथन के साथ एआई सीखें का एक निःशुल्क पाठ है। यह 4 में से 2वाँ पाठ है। इस अध्ययन पथ के 3 तक कोई भी पाठ पूरा पढ़ना निःशुल्क है — इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ व्यावहारिक अभ्यास भी उपलब्ध कराता है। यह पाइथन के साथ एआई सीखें सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
नीति और मान का संयोजन
Actor-Critic विधियाँ दो विचारों को मिलाती हैं: एक actor (क्रियाएँ चुनने वाली नीति) और एक critic (उनका मूल्यांकन करने वाला मान-फलन)। critic वास्तविक प्रतिफल की तुलना में कम-विचरण वाला संकेत देता है, जिससे सीखना अधिक स्थिर होता है।
actor
actor नीति नेटवर्क है। यह वर्तमान अवस्था के लिए क्रिया लॉगिट (या प्रायिकताएँ) निकालता है, ठीक REINFORCE की तरह, और तय करता है कि क्या करना है।
class ActorCritic(nn.Module):
def __init__(self, obs_dim, n_actions):
super().__init__()
self.shared = nn.Sequential(nn.Linear(obs_dim, 128), nn.ReLU())
self.actor = nn.Linear(128, n_actions)critic
critic अवस्था-मान V(s) का अनुमान लगाता है: अवस्था s से मिलने वाला अपेक्षित प्रतिफल। यह एकल-परिणाम शीर्ष होता है, जो बताता है कि वर्तमान स्थिति कितनी अच्छी है।
self.critic = nn.Linear(128, 1)
def forward(self, s):
h = self.shared(s)
return self.actor(h), self.critic(h)साझा आधार-परत, दो शीर्ष
actor और critic आम तौर पर शुरुआती परतों (आधार-परत) को साझा करते हैं और फिर दो शीर्षों में विभाजित हो जाते हैं। विशेषताओं को साझा करना दक्ष है और दोनों कार्यों को उपयोगी निरूपण सुदृढ़ करने देता है।
लाभ फलन
मुख्य राशि लाभ A = r + gamma * V(s') - V(s) है। यह मापती है कि कोई क्रिया critic की अपेक्षा से कितनी बेहतर थी। सकारात्मक लाभ का अर्थ है "औसत से बेहतर", जबकि नकारात्मक लाभ का अर्थ है बदतर।
advantage = reward + gamma * V_next - V_currentवास्तविक प्रतिफल से लाभ बेहतर क्यों है
पूर्ण प्रतिफल G_t के बजाय लाभ का उपयोग करने से संकेत critic के अनुमान के आसपास केंद्रित हो जाता है और विचरण बहुत कम हो जाता है। यही मुख्य कारण है कि actor-critic, REINFORCE की तुलना में अधिक स्थिरता से सीखता है।
actor की हानि
actor को REINFORCE की तरह प्रशिक्षित किया जाता है, लेकिन प्रतिफल के बजाय लाभ से भारित किया जाता है: सकारात्मक लाभ वाली क्रियाओं की प्रायिकता बढ़ाई जाती है।
actor_loss = -(log_prob * advantage.detach()).mean()critic की हानि
critic प्रतिफल का सटीक अनुमान लगाना सीखता है। इसकी हानि इसके अनुमान V(s) और देखे गए लक्ष्य r + gamma * V(s') के बीच की वर्ग त्रुटि होती है।
target = reward + gamma * V_next.detach()
critic_loss = (V_current - target).pow(2).mean()संयुक्त हानि
हानियों को जोड़कर दोनों शीर्षों को साथ में प्रशिक्षित करें (खोज को प्रोत्साहित करने के लिए अक्सर एक छोटा एंट्रॉपी बोनस भी दिया जाता है)। एक पश्चप्रसार चरण साझा आधार-परत और दोनों शीर्षों को अद्यतन करता है।
loss = actor_loss + 0.5 * critic_loss - 0.01 * entropy
loss.backward()समकालिक A2C
A2C (Advantage Actor-Critic) समकालिक संस्करण है: कई समानांतर कार्यकर्ता वातावरण की प्रतियों से एक साथ अनुभव एकत्र करते हैं, फिर एकल समकालिक अद्यतन उनके पूरे डेटा का उपयोग करता है, जिससे स्थिरता और प्रवाह-दक्षता बेहतर होती है।
# N parallel envs step together each iteration
# gather all transitions, then one combined updateA2C बनाम A3C
अतुल्यकालिक संस्करण A3C कार्यकर्ताओं को स्वतंत्र रूप से अद्यतन करने देता है। A2C उन्हें समकालिक करता है, जो सरल, GPU के लिए अधिक अनुकूल और आम तौर पर उतना ही प्रभावी है; इसी कारण यह लोकप्रिय है।
त्वरित जाँच
actor-critic की अपनी समझ का परीक्षण करें।
पुनरावृत्ति: Actor-Critic और A2C
आपने सीखा कि actor नीति लॉगिट निकालता है और critic V(s) का अनुमान लगाता है, अक्सर shared आधार-परत और दो शीर्षों के माध्यम से। लाभ r + gamma*V(s') - V(s) विचरण घटाता है और समकालिक A2C स्थिर, दक्ष प्रशिक्षण के लिए समानांतर कार्यकर्ताओं का उपयोग करता है।
एआई शिक्षक के साथ Python सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 53
- पाठ
- 225
अक्सर पूछे जाने वाले प्रश्न
क्या “Actor-Critic विधियाँ (A2C)” पाठ निःशुल्क है?
हाँ — पाइथन के साथ एआई सीखें अध्ययन पथ के 3 तक कोई भी पाठ, जिसमें “Actor-Critic विधियाँ (A2C)” भी शामिल है, यहाँ वेब पर पूरा पढ़ना निःशुल्क है। इसके बाद CoddyKit PRO हर पाठ अनलॉक करता है, साथ ही अंतर्निर्मित कोड संपादक और चौबीसों घंटे एआई शिक्षक के साथ इंटरैक्टिव अभ्यास भी उपलब्ध कराता है। पाइथन के साथ एआई सीखें पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“Actor-Critic विधियाँ (A2C)” में मैं क्या सीखूँगा?
Advantage function, actor (policy) और critic (value), तथा synchronous A2C कार्यान्वयन। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ पाइथन के साथ एआई सीखें का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या पाइथन के साथ एआई सीखें शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर पाइथन के साथ एआई सीखें शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 2वाँ पाठ है।
“Actor-Critic विधियाँ (A2C)” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस पाइथन के साथ एआई सीखें पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर पाइथन के साथ एआई सीखें पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- Policy Gradient विधियाँ: REINFORCE
- Actor-Critic विधियाँ (A2C)
- Proximal Policy Optimization (PPO)
- कस्टम Gymnasium एनवायरनमेंट