दर-सीमा और API कोटा प्रबंधन
अनुरोधों की गति सीमित करके, बढ़ते अंतराल के साथ पुनःप्रयास करके और प्रति-उपयोगकर्ता कोटा सँभालकर उत्पादन एजेंटों को प्रदाता की दर-सीमाओं और अनियंत्रित लागत से सुरक्षित रखें
दर-सीमा और API कोटा प्रबंधन, CoddyKit पर LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह का एक निःशुल्क पाठ है। यह 4 में से 4वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
आपके सामने आने वाली सीमाएँ
LLM प्रदाता दो तरीकों से उपयोग की सीमा तय करते हैं:
- प्रति मिनट अनुरोध (RPM)
- प्रति मिनट टोकन (TPM)
इन सीमाओं से अधिक होने पर कॉल 429 Too Many Requests लौटाती हैं, जिससे अधिक भार में आपके एजेंट रुक सकते हैं।
पहले से दर सीमित करना क्यों ज़रूरी है
429 की प्रतीक्षा करके पुनः प्रयास करना व्यर्थ है। पहले से किया गया दर सीमितकरण अनुरोधों के बीच अंतर रखता है, ताकि आप सीमा के भीतर रहें, ट्रैफ़िक सुचारु हो और त्रुटियों से पूरी तरह बचा जा सके।
क्लाइंट-पक्ष दर सीमितकर्ता
LangChain में मौजूद दर सीमितकर्ता मॉडल कॉल को नियंत्रित कर सकता है और प्रति सेकंड निश्चित संख्या में अनुरोध जारी करता है।
from langchain_core.rate_limiters import InMemoryRateLimiter
limiter = InMemoryRateLimiter(
requests_per_second=2,
max_bucket_size=5
)इसे मॉडल से जोड़ना
सीमितकर्ता को चैट मॉडल में पास करें। अब हर कॉल स्वचालित रूप से अपनी बारी की प्रतीक्षा करेगी।
llm = ChatOpenAI(
model='gpt-4o-mini',
rate_limiter=limiter
)घातीय बैकऑफ़ के साथ पुनः प्रयास
कुछ 429 और अस्थायी त्रुटियाँ अपरिहार्य होती हैं। बढ़ते विलंब के साथ पुनः प्रयास करें, ताकि आप प्रदाता पर लगातार भार न डालें।
llm_with_retry = llm.with_retry(
stop_after_attempt=5
)Retry-After का सम्मान करना
प्रदाता अक्सर Retry-After हेडर लौटाते हैं, जो बताता है कि कितनी देर प्रतीक्षा करनी है। निश्चित विलंब की तुलना में इसका पालन अधिक शिष्ट और प्रभावी होता है।
wait = int(response.headers.get('Retry-After', '1'))प्रत्येक उपयोगकर्ता की कोटा सीमाएँ
प्रदाताओं की सीमाओं के अलावा, लागत और निष्पक्षता नियंत्रित करने के लिए आप अपनी प्रति-उपयोगकर्ता कोटा सीमाएँ निर्धारित करते हैं। Redis जैसे स्टोर में उपयोग का लेखा रखें और जब कोई उपयोगकर्ता अपनी अनुमति-सीमा पार कर ले, तो अनुरोध अस्वीकार करें या कतार में डालें।
used = redis.incr(f'quota:{user_id}')
if used > DAILY_LIMIT:
raise QuotaExceeded()टोकन बकेट एल्गोरिदम
सामान्य तरीका टोकन बकेट है: टोकन एक स्थिर दर से फिर भरते हैं, हर अनुरोध एक टोकन खर्च करता है और खाली बकेट का अर्थ है कि प्रतीक्षा करनी होगी। यह औसत दर लागू रखते हुए थोड़े समय के लिए अधिक अनुरोधों की अनुमति देता है।
भार बढ़ने पर कतार बनाना
जब माँग आपकी सीमाओं से अधिक बढ़ जाए, तो अनुरोध हटाने के बजाय उन्हें कतार में डालें। एक पृष्ठभूमि कार्यकर्ता कतार को सुरक्षित दर से खाली करता है और सिस्टम को स्थिर बनाए रखता है।
कुंजियों में भार बाँटना
अधिक थ्रूपुट के लिए आप कई API कुंजियों या प्रदाताओं के बीच बारी-बारी से उपयोग कर सकते हैं और भार इस तरह बाँट सकते हैं कि कोई एक कुंजी अपनी सीमा तक न पहुँचे। हर कुंजी के उपयोग का स्वतंत्र रूप से लेखा रखें।
सीमाओं की निगरानी
429 की दरों और इस बात पर नज़र रखें कि आप सीमाओं के कितने निकट पहुँच रहे हैं। 429 की बढ़ती दरें बताती हैं कि उपयोगकर्ताओं को विफलताएँ दिखाई देने से पहले आपको उच्च स्तर, बेहतर थ्रॉटलिंग या अधिक कुंजियों की आवश्यकता है।
त्वरित जाँच
अपनी दर-सीमित करने की समझ जाँचें।
पुनरावलोकन
आपने उत्पादन परिवेश में सीमाओं और कोटा को प्रबंधित करना सीखा:
- प्रदाता RPM और TPM की सीमाएँ तय करते हैं; 429 एजेंटों को बाधित करते हैं
- पहले से थ्रॉटल करने के लिए
InMemoryRateLimiterका उपयोग करें - बैकऑफ़ के साथ पुनःप्रयास जोड़ें और
Retry-Afterका पालन करें - टोकन बकेट से प्रति-उपयोगकर्ता कोटा लागू करें
- कतार बनाएँ, कुंजियों को बदल-बदलकर उपयोग करें और 429 की दरों पर नज़र रखें
सीमाओं का अच्छा प्रबंधन बड़े पैमाने पर काम करने वाले एजेंटों को विश्वसनीय और किफायती बनाए रखता है।
एआई शिक्षक के साथ LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह सीखें — निःशुल्क
अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।
- पाठ्यक्रम
- 12
- पाठ
- 50
अक्सर पूछे जाने वाले प्रश्न
क्या “दर-सीमा और API कोटा प्रबंधन” पाठ निःशुल्क है?
हाँ—“दर-सीमा और API कोटा प्रबंधन” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह पाठ्यक्रम में कुल 4 पाठ शामिल हैं।
“दर-सीमा और API कोटा प्रबंधन” में मैं क्या सीखूँगा?
अनुरोधों की गति सीमित करके, बढ़ते अंतराल के साथ पुनःप्रयास करके और प्रति-उपयोगकर्ता कोटा सँभालकर उत्पादन एजेंटों को प्रदाता की दर-सीमाओं और अनियंत्रित लागत से सुरक्षित रखें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।
क्या LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?
पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 4वाँ पाठ है।
“दर-सीमा और API कोटा प्रबंधन” पाठ पूरा करने में कितना समय लगता है?
CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।
क्या मैं इस LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह पाठ में कोड लिख और चला सकता हूँ?
हाँ। हर LangChain के साथ AI एजेंट और स्वायत्त कार्यप्रवाह पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।
इस पाठ्यक्रम के सभी पाठ
- क्लाउड मंचों पर एजेंट का परिनियोजन
- एजेंट स्थिति और सत्रों का प्रबंधन
- एजेंट आर्किटेक्चर का विस्तार
- दर-सीमा और API कोटा प्रबंधन