AI एजेंट · पाठ

बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench

कोडिंग एजेंटों (SWE-Bench), सामान्य सहायकों (GAIA) और उपकरण उपयोग (ToolBench) के लिए सार्वजनिक बेंचमार्क।

पाठ 4, कुल 4 में से15 चरण

बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench, CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।

सार्वजनिक मानक परीक्षण

टीमों के बीच मॉडलों और ढाँचों की तुलना करने के लिए सार्वजनिक मानक परीक्षण आवश्यक हैं। इनमें एजेंट की सामान्य क्षमताएँ शामिल होती हैं:

  • SWE-Bench — सॉफ़्टवेयर अभियांत्रिकी कार्य
  • GAIA — सामान्य सहायक कार्य
  • ToolBench / BFCL — उपकरण उपयोग
  • WebArena — ब्राउज़र में मार्गदर्शन

SWE-Bench

SWE-Bench यह जाँचता है कि कोई एजेंट वास्तविक GitHub समस्याएँ हल कर सकता है या नहीं:

  • लोकप्रिय Python रिपॉज़िटरी से 2294 वास्तविक समस्याएँ
  • एजेंट को ऐसा पैच तैयार करना होता है जो सभी छिपे परीक्षणों में सफल हो
  • अग्रणी अत्याधुनिक एजेंट अब 50-70% समस्याएँ हल करते हैं (2023 में यह <5% था)

SWE-Bench Verified

OpenAI ने अधिक कठोर गुणवत्ता-जाँच वाला 500 समस्याओं का उपसमुच्चय जारी किया (SWE-Bench Verified)। यह उद्योग का मानक है।

GAIA

सामान्य कृत्रिम बुद्धिमत्ता सहायक का मानक परीक्षण (Meta + HF, 2023):

  • तीन कठिनाई स्तरों में 466 प्रश्न
  • ब्राउज़िंग, कोड निष्पादन और बहु-माध्यमी तर्क की आवश्यकता
  • इस तरह बनाया गया है कि एक मनुष्य इसे लगभग 30 सेकंड में हल कर सके; अग्रणी एजेंट लगभग 60% तक पहुँचते हैं

GAIA प्रश्न का उदाहरण

"1972 और 1985 के बीच Mercedes Sosa के कितने स्टूडियो एल्बम प्रकाशित हुए? उनकी अंग्रेज़ी Wikipedia पृष्ठ की सूची का उपयोग करें।"

इसके लिए ब्राउज़िंग, तालिका पढ़ना और गिनती आवश्यक है — ये बहु-चरणीय एजेंट कार्यों के सामान्य उदाहरण हैं।

बर्कले फ़ंक्शन-कॉलिंग लीडरबोर्ड (BFCL)

उपकरण-कॉलिंग मूल्यांकन का मानक:

  • हज़ारों (प्रश्न, उपकरण-परिभाषा, अपेक्षित कॉल) त्रिक
  • सरल, समानांतर और छूटे हुए उपकरण वाले परिदृश्य शामिल
  • हर तिमाही अपडेट किया जाता है

ToolBench

बड़ा, लेकिन अधिक अव्यवस्थित: RapidAPI से 16k+ API और बहु-चरणीय उपकरण-श्रृंखलाएँ। BFCL की तुलना में कम मानकबद्ध, लेकिन अधिक व्यापक क्षेत्र को शामिल करता है।

WebArena

वेब-ब्राउज़िंग एजेंट के लिए ओपन-सोर्स मानक परीक्षण। इसमें 4 स्वतंत्र वेबसाइटें (ई-कॉमर्स, फ़ोरम, डेवलपर पोर्टल और GitLab) होस्ट की गई हैं; एजेंट को वास्तविक जैसे कार्य पूरे करने होते हैं।

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

मानक परीक्षणों की सीमाएँ

  • सार्वजनिक मानक परीक्षण प्रशिक्षण डेटा में लीक हो जाते हैं (परिणामों से खेलकर लाभ लेने का जोखिम)
  • एकल-क्षेत्रीय — आपका कार्य अधिक कठिन या आसान हो सकता है
  • "X% हल करें" से यह छिप जाता है कि कौन-से X% हैं — दुर्लभ मामलों का लंबा सिरा महत्वपूर्ण है

आपका अपना मानक परीक्षण अधिक महत्वपूर्ण है

सार्वजनिक मानक परीक्षण तरीकों की तुलना करने के लिए उपयोगी हैं। लेकिन YOUR डेटा पर बना आपका अपना स्वर्ण-समुच्चय ही YOUR उत्पाद के लिए मायने रखने वाली एकमात्र संख्या है।

आंतरिक और सार्वजनिक का संयोजन

स्वस्थ टीम की कार्यप्रणाली:

  • अत्याधुनिक क्षमता पर नज़र रखने के लिए हर तिमाही सार्वजनिक मानक परीक्षण चलाएँ
  • हर PR पर आंतरिक मूल्यांकन चलाएँ
  • निर्णयों के लिए आंतरिक आँकड़ों पर भरोसा करें; क्षेत्र की स्थिति समझने के लिए सार्वजनिक आँकड़े पढ़ें

मानक परीक्षण के परिणाम पढ़ना

जब किसी शोध-पत्र में कहा जाए कि "SWE-Bench पर 75%":

  • जाँचें कि WHICH SWE-Bench है (Lite, Verified या full)
  • जाँचें कि कई प्रयासों की अनुमति थी या नहीं
  • जाँचें कि छिपे हुए उपकरण या संकेतों का उपयोग किया गया था या नहीं

शीर्षक में दिए आँकड़ों को गलत समझना आसान है।

आंतरिक बनाम सार्वजनिक मूल्यांकन

आपके उत्पाद के लिए इनमें से अधिक महत्वपूर्ण क्या है?

पुनरावलोकन

कोड एजेंट के लिए SWE-Bench, सामान्य सहायकों के लिए GAIA, उपकरण उपयोग के लिए BFCL और ब्राउज़र के लिए WebArena। क्षेत्र की स्थिति समझने के लिए इनका उपयोग करें; निर्णयों के लिए अपने मूल्यांकन पर भरोसा करें।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
60
पाठ
239

अक्सर पूछे जाने वाले प्रश्न

क्या “बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench” पाठ निःशुल्क है?

हाँ—“बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench” में मैं क्या सीखूँगा?

कोडिंग एजेंटों (SWE-Bench), सामान्य सहायकों (GAIA) और उपकरण उपयोग (ToolBench) के लिए सार्वजनिक बेंचमार्क। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।

“बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. एजेंटों के लिए मूल्यांकन-आधारित विकास
  2. स्वर्णिम टेस्ट सेट बनाना
  3. LLM-जज की कमियाँ
  4. बेंचमार्क सुइट: SWE-Bench, GAIA, ToolBench
← AI एजेंट पर वापस जाएँ