AI एजेंट · पाठ

एजेंटिक तर्क (o1, o3, Reasoning Models)

ऐसे मॉडल जो उत्तर देने से पहले 'सोचते' हैं — आंतरिक chain-of-thought, test-time compute और स्व-सुधार।

पाठ 1, कुल 4 में से15 चरण

एजेंटिक तर्क (o1, o3, Reasoning Models), CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 1वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।

मॉडल की एक नई श्रेणी

OpenAI o1 (सितंबर 2024) ने "रीज़निंग मॉडल" प्रस्तुत किए — ऐसे LLM जो दिखाई देने वाला answer देने से पहले चरण-दर-चरण स्पष्ट रूप से तर्क करते हैं। इनके उत्तराधिकारियों में o3, DeepSeek R1, विस्तृत चिंतन वाला Claude, Gemini 2.5 thinking और कई अन्य शामिल हैं।

ये कैसे काम करते हैं

तुरंत answer बनाने के बजाय, model:

  1. एक लंबा आंतरिक "thinking" क्रम उत्पन्न करता है (CoT-शैली)
  2. कई तरीकों का अन्वेषण करता है
  3. स्वयं को सुधारता है
  4. फिर अंतिम दिखाई देने वाला answer देता है

परीक्षण-समय गणना

आप चुन सकते हैं कि model कितना "thinking" करे। सोचने में अधिक टोकन खर्च करने से कठिन समस्याओं पर बेहतर उत्तर मिलते हैं। इसकी सीमा अधिक विलंबता और लागत है।

OpenAI o-Series API

response = client.chat.completions.create(
    model='o3-mini',
    messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
    reasoning_effort='high'   # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens)   # how many 'thinking' tokens were used

Anthropic Extended Thinking

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=8192,
    thinking={'type': 'enabled', 'budget_tokens': 4096},
    messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answer

रीज़निंग मॉडल कब उत्कृष्ट होते हैं

  • बहु-चरणीय गणित
  • जटिल तर्क वाले कोड का निर्माण
  • कानूनी / वैज्ञानिक तर्क
  • आगे की स्थितियों को ध्यान में रखकर योजना बनाना

बेंचमार्क: o3, AIME पर 90% से अधिक और GPQA पर ऊँचे अंक प्राप्त करता है — गैर-रीज़निंग मॉडल से बहुत आगे।

मानक मॉडल कब बेहतर होते हैं

  • सरल बातचीत / प्रश्नोत्तर — रीज़निंग व्यर्थ जाती है
  • विलंबता-संवेदी मार्ग — रीज़निंग में कुछ सेकंड जुड़ जाते हैं
  • लागत-संवेदी बड़े पैमाने का कार्य — रीज़निंग लागत को कई गुना बढ़ा देती है
  • शैली / स्वरूपण के कार्य — कोई लाभ नहीं

लागत का स्वरूप

रीज़निंग टोकन की गणना मूल्य निर्धारण में होती है। उच्च प्रयास पर o3-mini एक प्रश्न के लिए 10k–100k thinking टोकन उपयोग कर सकता है। बड़े रीज़निंग मॉडल पर इसकी लागत प्रति प्रश्न $0.10–$1 हो सकती है।

एजेंट लूप के भीतर

किसी बड़े एजेंट के भीतर planner के रूप में रीज़निंग model का उपयोग:

  • रीज़निंग model: योजना बनाना / निर्णय लेना / मूल्यांकन करना
  • मानक model: चरणों को पूरा करना
  • उपकरण कॉल: सामान्य रूप से चलाना

दोनों का सर्वोत्तम लाभ: जहाँ ज़रूरी हो वहाँ गहन रीज़निंग, और बाकी जगह सस्ता निष्पादन।

ऊपर से CoT थोपें नहीं

रीज़निंग मॉडल के साथ अब "आइए चरण-दर-चरण सोचें" जैसे प्रॉम्प्ट की आवश्यकता नहीं है — वे पहले से ही आंतरिक रूप से CoT करते हैं। इसे जोड़ने से वास्तव में प्रदर्शन खराब हो सकता है।

ओपन-सोर्स रीज़निंग

DeepSeek R1, R1-Distill और अन्य model खुले वेट में रीज़निंग लाते हैं। ये HuggingFace, Together AI आदि पर उपलब्ध हैं।

अनुसंधान की सीमा

  • Reflection-tuning — मॉडल को स्वयं की आलोचना करना सिखाना
  • Search-based inference — अनुमान के समय Tree-of-Thoughts, MCTS
  • Test-time training — प्रत्येक query के अनुसार वेट को अनुकूलित करना

सावधानी: ब्लैक-बॉक्स चिंतन

रीज़निंग model के "thoughts" आमतौर पर आपसे छिपाए जाते हैं (OpenAI) या उनका सारांश दिया जाता है (Anthropic)। सीमित पारदर्शिता से त्रुटि-निवारण कठिन हो जाता है; इसके बजाय इनपुट/आउटपुट मूल्यांकन पर निर्भर रहें।

रीज़निंग मॉडल का उपयोग कब करें

किस कार्य के लिए रीज़निंग model की अतिरिक्त लागत सबसे अधिक उचित है?

पुनरावलोकन

रीज़निंग मॉडल (o1, o3, R1, Claude extended thinking) कठिन कार्यों पर गुणवत्ता के बदले समय और लागत लेते हैं। इन्हें एजेंट के भीतर planner/judge के रूप में उपयोग करें। सरल बातचीत के लिए इनसे बचें।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
60
पाठ
239

अक्सर पूछे जाने वाले प्रश्न

क्या “एजेंटिक तर्क (o1, o3, Reasoning Models)” पाठ निःशुल्क है?

हाँ—“एजेंटिक तर्क (o1, o3, Reasoning Models)” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“एजेंटिक तर्क (o1, o3, Reasoning Models)” में मैं क्या सीखूँगा?

ऐसे मॉडल जो उत्तर देने से पहले 'सोचते' हैं — आंतरिक chain-of-thought, test-time compute और स्व-सुधार। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 1वाँ पाठ है।

“एजेंटिक तर्क (o1, o3, Reasoning Models)” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. एजेंटिक तर्क (o1, o3, Reasoning Models)
  2. हाइब्रिड प्रतीकात्मक + न्यूरल एजेंट
  3. बहुमॉडल एजेंट (विज़न + आवाज़ + क्रिया)
  4. खुली समस्याएँ: मजबूती, संरेखण, दीर्घ-अवधि मेमोरी
← AI एजेंट पर वापस जाएँ